中文

推理模型中的测试时扩展尚未有效应用于知识密集型任务

人工智能 2026-02-03 v2 计算与语言 机器学习

摘要

测试时扩展通过允许模型生成长推理链来增加推理时计算量,已在多个领域中提升了性能。然而,在本文中,我们表明该方法目前对知识密集型任务尚不有效。我们在两个知识密集型基准上评估了 14 个推理模型,发现增加测试时计算量并未持续提高准确率,且经常加剧幻觉。进一步分析表明,在增加测试时计算量下幻觉率的变化主要由模型回答意愿驱动。我们还观察到,延长推理可能引发确认偏差,导致过度自信的幻觉。最后,我们给出了信息论视角的解释:仅依赖计算的测试时扩展是对固定已训练模型的后处理,因此无法增加超出模型已编码信息的关于真实答案的信息,这解释了其在知识密集型任务上收益有限的原因。代码和数据可在 https://github.com/XuZhao0/tts-knowledge 获取。

关键词

引用

@article{arxiv.2509.06861,
  title  = {Test-Time Scaling in Reasoning Models Is Not Effective for Knowledge-Intensive Tasks Yet},
  author = {James Xu Zhao and Bryan Hooi and See-Kiong Ng},
  journal= {arXiv preprint arXiv:2509.06861},
  year   = {2026}
}

备注

Added theoretical analysis. 31 pages, 8 figures, 11 tables