
前OpenAI安全研究副总裁翁荔,在停更13个月后,突然发布了一篇超过万字的技术长文,标题就叫《Scaling Laws, Carefully》。她自己都说“迟到了三年多”,但一上来就抛出一个让整个AI行业坐不住的观点:当前大模型的数据配比,很可能从一开始就走偏了。
这事得从2020年说起。那年,OpenAI的研究员Jared Kaplan发了一篇论文,说模型训练损失和参数量、数据量、算力呈漂亮幂律下降——简单理解就是,模型规模越大越好,参数增长要比数据增长得更快。GPT-3就是按这个思路造出来的:1750亿个参数,但训练数据只用了3000亿个token(相当于单词或片段)。结果呢?两年后,DeepMind团队用更大规模的实验推翻了这套说法。
DeepMind做了个对比:他们拿2800亿参数的Gopher模型,和700亿参数的Chinchilla模型,在相同算力下训练。Chinchilla参数只有Gopher的四分之一,但训练数据是四倍多——最后在所有测试中,Chinchilla全面碾压Gopher。这说明什么?参数和数据应该等比增长,最佳比例大约是1:20,而不是Kaplan说的参数飙升、数据慢悠悠跟着。这也解释了为什么后来的Llama、DeepSeek等模型,参数比GPT-3少,性能却强得多。
那Kaplan为啥会搞错?翁荔分析,他当时实验最大模型只有15亿参数,在小规模区间拟合出来的规律,外推到万亿级别,就变成了系统性错误。更乌龙的是,他排除掉了embedding层的参数,而这一层在小型模型上影响巨大。还有更离谱的——2024年,Epoch AI团队逐行复现DeepMind的Chinchilla拟合代码时,发现两个bug:损失函数取的是均值而不是求和,导致优化器误判收敛;核心幂律指数被四舍五入到两位数,产生了虚假的精确度。修正之后,数据再次印证了等比增长。
但问题还没完。上述所有讨论都建立在“训练数据无限且不重复”的前提下。现实是,高质量文本数据预计在2026到2028年就要枯竭了。研究显示,重复数据的有效价值呈指数衰减,每多训练一轮,边际收益就急剧下降。翁荔在文章里嵌入了一个交互式模拟器,直观展示出工程细节有多敏感——你只要微调一下拟合精度或噪声水平,外推预测就可能差出十万八千里。
最后,翁荔写下了一句三年来凝练的判断:Scaling Laws不是物理定律,它是对工程细节高度敏感的观测性指南。她认为,业界该重新审视预训练配方了——几百亿美元砸下去的路径,可能需要彻底反思。