能力是负债吗?更强大的语言模型在关键时刻会进行更差的预测
人工智能
2026-05-25 v2
摘要
我们记录了在底层时间序列呈现超线性增长且存在灾难性变化风险的预测问题上,大语言模型 (LLM) 存在逆向标度现象,这类结构在金融和流行病学中常见。在这些任务上,更强大的模型会产生更差的分布性预测。该模式在我们发布的 ForecastBench-Sim (FBSim),一个无污染的、模拟世界基准测试中出现,通过对合成 SIR 流行病的预测以及与之匹配的线性控制器进行比较,并在新冠肺炎、脊髓灰质炎、房地产市场和高通胀等真实世界数据集中得到复制。分解显示,失败集中在上尾部,更强大的模型将上尾部向上移动,以追踪增长的激进外推,而下尾部保持不变。Llama-3.1 的系列内部研究表明,模型规模和后训练都独立地导致这一效应。领域知识并不能可靠地恢复校准。这一逆向标度在 LLM 预测基准中常见的单阈值指标中并不存在,反转了能力-准确性关系的符号在相同输出上。单阈值评分在常规阈值 cutoff 下忽略了上尾部成本;包含尾部的评分则在相同输出上反转了能力-准确性关系。我们建议 LLM 预测评估使用连续(且无上限)的准确性度量标准,以及受限的二元阈值指标。
引用
@article{arxiv.2605.22672,
title = {Is Capability a Liability? More Capable Language Models Make Worse Forecasts When It Matters Most},
author = {Nick Merrill and Jaeho Lee and Ezra Karger},
journal= {arXiv preprint arXiv:2605.22672},
year = {2026}
}