中文

FRIT:利用因果重要性提高链措置忠诚度

人工智能 2025-09-18 v1 机器学习

摘要

链措置推理(Chain-of-Thought, CoT)已成为提高大型语言模型在复杂任务上性能的强大工具, 但近期研究表明, 推理步骤常常未对最终答案产生因果影响, 从而导致输出脆弱且不可信。先前的方法主要聚焦于衡量忠诚度, 而系统性改进方法则有限。我们引入基于干预训练的忠诚推理(FRIT), 一种可扩展的对齐方法, 通过学习来自系统性损坏示例的模型, 训练模型产生因果一致的推理。FRIT 通过对模型生成的 CoT 中的 individual 推理步骤进行干预, 生成忠诚/不忠诚配对, 以突出推理何时失效。随后应用直接偏好优化, 教导模型优先选择因果一致的推理路径。在 GSM8K 上的 Qwen3-8B 和 Mistral-7B-v0.1 上进行评估, FRIT 在 Mistral 上实现 3.4 个百分点的忠诚推理提升, 同时在准确性方面提升 7.6 个百分点。我们的方法提供了首个可扩展且无监督的方法, 训练语言模型产生更可靠且可解释的推理, 解决了推理性能与可信度之间的关键鸿沟。我们在 https://github.com/Anut-py/frit 上发布了代码。

关键词

引用

@article{arxiv.2509.13334,
  title  = {FRIT: Using Causal Importance to Improve Chain-of-Thought Faithfulness},
  author = {Anand Swaroop and Akshat Nallani and Saksham Uboweja and Adiliia Uzdenova and Michael Nguyen and Kevin Zhu and Sunishchal Dev and Ashwinee Panda and Vasu Sharma and Maheep Chaudhary},
  journal= {arXiv preprint arXiv:2509.13334},
  year   = {2025}
}