中文

推理模型懂得什么信息重要,并在其激活中编码这一点

计算与语言 2026-04-21 v1

摘要

语言模型通常通过生成长式推理链来解决复杂任务,推理链包含众多步骤且重要性不等。虽然某些步骤对于生成最终答案至关重要,另一些则可被去除。确定哪些步骤最重要以及背后的原因,这仍是一个关于模型如何处理推理的核心开放问题。我们研究了通过模型内部信息还是通过推理链本身的标记来回答这一问题更为理想。我们发现,模型激活相较于标记能够提供更多用于识别重要推理步骤的信息。关键在于,通过在模型激活上训练探针来预测步骤的重要性,我们展示了模型即在后续步骤生成之前就已编码一种内部表示,这种重要性表示会随模型而普遍,分布在多个层次上,且不与表层特征相关,如步骤在链中的相对位置或其长度。我们的发现表明,分析激活可以揭示表层方法根本无法捕捉的推理方面,表明推理分析应关注模型内部。

关键词

引用

@article{arxiv.2604.18307,
  title  = {Reasoning Models Know What's Important, and Encode It in Their Activations},
  author = {Yaniv Nikankin and Martin Tutek and Tomer Ashuach and Jonathan Rosenfeld and Yonatan Belinkov},
  journal= {arXiv preprint arXiv:2604.18307},
  year   = {2026}
}