推理模型中的测试时扩展尚未有效应用于知识密集型任务
人工智能
2026-02-03 v2 计算与语言
机器学习
摘要
测试时扩展通过允许模型生成长推理链来增加推理时计算量,已在多个领域中提升了性能。然而,在本文中,我们表明该方法目前对知识密集型任务尚不有效。我们在两个知识密集型基准上评估了 14 个推理模型,发现增加测试时计算量并未持续提高准确率,且经常加剧幻觉。进一步分析表明,在增加测试时计算量下幻觉率的变化主要由模型回答意愿驱动。我们还观察到,延长推理可能引发确认偏差,导致过度自信的幻觉。最后,我们给出了信息论视角的解释:仅依赖计算的测试时扩展是对固定已训练模型的后处理,因此无法增加超出模型已编码信息的关于真实答案的信息,这解释了其在知识密集型任务上收益有限的原因。代码和数据可在 https://github.com/XuZhao0/tts-knowledge 获取。
引用
@article{arxiv.2509.06861,
title = {Test-Time Scaling in Reasoning Models Is Not Effective for Knowledge-Intensive Tasks Yet},
author = {James Xu Zhao and Bryan Hooi and See-Kiong Ng},
journal= {arXiv preprint arXiv:2509.06861},
year = {2026}
}
备注
Added theoretical analysis. 31 pages, 8 figures, 11 tables