衡量大规模推理模型思考草稿的忠实性
人工智能
2025-05-30 v2
摘要
大规模推理模型(LRM)通过引入思考草稿,使其能够在产生最终答案前进行多路径链式思考探索,从而大幅提升了复杂问题解决能力。确保这些中间推理过程的忠实性对于可靠的监控、解释和有效控制至关重要。本文提出了一套系统性的反事实干预框架,以严格评估思考草稿的忠实性。我们的 метод 焦点包括两个互补维度:(1) 草稿内部忠实性,评估单个推理步骤是否通过反事实步骤插入来影响后续步骤和最终草稿结论;(2) 从草稿到答案的忠实性,评估最终答案是否与思考草稿在逻辑上一致且依赖该草稿,通过扰动草稿的结论逻辑来实现。我们在六个最先进的 LRM 上进行了大规模实验。我们的发现表明,当前 LRM 在中间推理步骤方面仅表现出选择性忠实性,并且经常未能忠实地对草稿结论进行对齐。这些结果凸显了在先进 LRM 中需要更可靠且可解释的推理的必要性。
引用
@article{arxiv.2505.13774,
title = {Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models},
author = {Zidi Xiong and Shan Chen and Zhenting Qi and Himabindu Lakkaraju},
journal= {arXiv preprint arXiv:2505.13774},
year = {2025}
}