自回归语言模型的能力上限:来自知识密集型任务的实证证据
人工智能
2025-10-28 v1
摘要
我们记录了解码器自回归语言模型在知识密集型任务中的经验性能力上限。对OPT和Pythia模型家族(70M-30B参数,跨越240倍规模)进行系统评估,发现知识检索任务的准确率几乎没有提升,尽管损失值平稳下降。在MMLU数学基准测试中,准确率在所有规模下保持在19-20%(低于25%的随机猜测),而交叉熵损失下降了31%。相比之下,像算术这样的程序化任务显示出典型的规模效应,即两种指标都同步提升。注意力干预实验揭示了高度对扰动的敏感性:在模型之间交换注意力模式会导致性能灾难性崩溃(完全丢失准确率),而非优雅退化。这些测量结果对使用OPT和Pythia架构的知识密集型应用具有直接的工程意义:对于这些架构,参数规模超过1-2B几乎不会带来显著的准确率提升,尽管损失值仍持续改进。我们的发现量化了这些模型家族中特定能力的规模失效情况,以为资源分配决策提供依据。是否这些模式反映了解码器自回归架构的根本限制,或仅为实现特定限制,仍是一个需要在 diverse architectural approaches 下进行调查的开放问题。
引用
@article{arxiv.2510.21866,
title = {Capability Ceilings in Autoregressive Language Models: Empirical Evidence from Knowledge-Intensive Tasks},
author = {Javier Marín},
journal= {arXiv preprint arXiv:2510.21866},
year = {2025}
}
备注
The experiments in this paper were performed in January 2024. Current model architectures are considerably more complex than those presented here