语言模型是否会随新信息更新其预测?
计算与语言
2026-02-10 v2
摘要
先前的工作大多将预测视为静态任务,未考虑随着新证据的出现,预测及其置信度应如何演变。为解决这一问题,我们引入EvolveCast,一个用于评估大型语言模型在面对新信息时是否应恰当地修订其预测的框架。具体而言,EvolveCast 评估 LLMs 在其训练截止日期之后发布的信息时,其预测是否得到更新。我们使用人类预测者作为比较参考来评估在新信息下的预测更新和置信度校准。尽管 LLMs 对新信息表现出一定的响应性,但其更新往往是不一致的或过于保守的。我们进一步发现,无论是基于语言表述的置信度估计还是基于 logits 的置信度估计,都远远不达到人类参考标准的水平。在各种 LLMs 的设置下,模型倾向于保守地更新其预测。这一发现表明,当前(例如基于RAG的方法)用于更新模型知识的做法不足以进行概率推理;模型将新信息视为检索上下文,而非影响后验概率的证据。EvolveCast 因此凸显了需要更健壮的机制来将外部知识纳入信念动态的必要性。
引用
@article{arxiv.2509.23936,
title = {Do Language Models Update their Forecasts with New Information?},
author = {Zhangdie Yuan and Zifeng Ding and Andreas Vlachos},
journal= {arXiv preprint arXiv:2509.23936},
year = {2026}
}