Scaling Law 不是物理定律,是「外推幻觉」
「参数越多、数据越多、算力越多,模型效果越好」——Scaling Law 这条曲线被行业里很多人当成类似牛顿定律那样确定性成立的规律来引用,用来论证「继续加大投入必然继续有回报」。这篇文章想戳破的是这个类比本身:Scaling Law 从头到尾是对已有实验数据点的经验拟合,不是对未来必然成立的物理规律,把两者混为一谈,就是一种「外推幻觉」。
我的立场:Scaling Law 本身是真实、有用的观察——过去几年模型性能随参数量、数据量、算力投入按幂律关系提升,这个趋势在已验证的区间里确实成立,OpenAI、DeepMind 等机构的多篇论文都给出过一致的拟合结果。但「在观测区间内拟合得好」和「可以无限外推到观测区间之外」是两件不同的事,前者是统计工作,后者是一个未经证明的假设。行业里最大的认知偏差,就是把「拟合得很准」偷换成了「规律必然成立」。
物理定律和经验拟合的根本区别
物理定律(比如万有引力定律)之所以能被称为「定律」,是因为它背后有可以独立验证的机制解释,且这套机制在任意尺度下都成立,不依赖于「过去观测到的数据点恰好落在这条曲线上」。Scaling Law 完全不是这种东西:它是研究者拿一批不同规模的模型跑出的实际性能数据,画在对数-对数坐标(log-log plot)上,发现这些点大致落在一条直线附近,于是拟合出一条幂律曲线。这条曲线描述的是「过去这批实验里发生了什么」,不是「模型规模和性能之间存在某种必然的因果机制」。没有人能从第一性原理推导出为什么性能提升必须服从这个具体的幂律指数,这个指数本身是拟合出来的经验参数,换一批训练数据、换一种架构,指数就可能变。
「外推幻觉」具体错在哪
外推幻觉的核心问题是:一条曲线在已观测区间内拟合得再好,也不能保证它在区间之外继续成立。这在统计学里是一个基础常识——任何有限的数据点都可以被无数条不同的曲线完美拟合,选择「继续沿同一条幂律曲线走下去」只是众多可能性中最简单、最符合直觉的一种,不是唯一正确的一种。现实中已经出现过 Scaling Law 在某个尺度之后出现拐点、边际收益骤降、甚至某些能力提升停滞的案例——这些都是「外推失效」的直接证据,而不是异常噪声。把一条基于历史数据画出的趋势线,当成对未来的确定性保证,本质上和把过去三年股价涨了就假设明年一定继续涨是同一种逻辑错误,只是套了一层数学公式的外壳,看起来更「科学」。
我认为 Scaling Law 被过度神化,背后有一个不便明说的商业动机:如果 Scaling Law 是「定律」,那么继续投入更多算力、融更多钱去堆更大的模型,就是一件风险极低、几乎确定有回报的事——这个叙事对需要说服投资人持续加注的公司极其有利。但如果承认它只是「目前观测区间内的经验拟合,外推存在不确定性」,继续加大投入就变成了一个需要独立论证的赌注,说服力立刻下降。把经验规律包装成确定性定律,是一种在技术叙事之外发生的资本叙事需要,这也是为什么这个类比在融资 PPT 和媒体报道里出现的频率,远高于它在严肃的技术论文里被真正当作「定律」使用的频率。
对个人判断力的现实建议是:看到任何用 Scaling Law 论证「未来必然如何」的表述,先问一句这个外推是否已经超出了已验证的观测区间。在区间内引用它是合理的技术判断,超出区间外推则是一个需要额外证据支撑的假设,两者不能用同一种确定性的语气去表达。