改进参数化知识在推理语言模型中的访问方式
计算与语言
2026-02-26 v1
摘要
我们研究了如何访问语言模型参数中存储的世界知识。例如,回忆澳大利亚首都堪培拉的信息,可能有助于通过思考主要城市和目的地建设首都的概念来实现。虽然推理语言模型通过强化学习训练,以在数学等任务上生成推理轨迹,但它们在访问自身世界知识方面的推理能力可能不足。我们首先发现,模型默认情况下并不会生成其最佳世界知识推理:添加一个简单的“逐步思考”提示,在知识回忆方面显示出统计显著的改进,但在数学方面则没有。基于此,我们提出了使用世界知识问答作为可验证奖励来训练模型对参数化知识进行推理。经过在TriviaQA上的强化学习训练后(提升9.9%),该方法在Natural Questions、HotpotQA、SimpleQA和StrategyQA上的性能分别提升了4.2%、2.1%、0.6%和3.0%。推理模型在参数化知识访问方面存在优化不足,但可以轻松训练得更好。
引用
@article{arxiv.2602.22193,
title = {Improving Parametric Knowledge Access in Reasoning Language Models},
author = {Melody Ma and John Hewitt},
journal= {arXiv preprint arXiv:2602.22193},
year = {2026}
}