阿朱说 现在大模型推理能力的往前龟爬,主要依赖数据,而不是在模型架构层创新:一、训练时输入数据专用目标数据(比如编程大模型所需的开源代码数据)数据质量(这非常消耗人肉专家来整理)高质量数据的规模有高质量数据,还得与模型参数架构设计匹配。数据如水、模型如水瓶,水瓶不够大,再多的水装不进去。但模型也不能无限大,架构不好,模型就会如大厦一样坍塌。去年DeepSeek发布的mHC方法让大模型可以做大了。这样就能走上水多加面、面多加水的螺旋上升。二、微调时输入数据人工专家人肉构建思维链:给推导过程提示模板、给示例。比如现在流行的Skills本质就是这个。虽然现在大模型也能开始帮助人肉专家加速构建思维链,但还是需要人肉专家大量工作。比如现在流行的Palantir,本质上也是结构化构建这个思维链(对象-关