结果合理化:RL诱导的大语言模型思维链中的动机推理
机器学习
2026-03-10 v2 人工智能
摘要
链式思维(CoT)监控已成为检测有害行为(如推理模型中的奖励作弊)的引人入胜的方法,假设模型的推理过程对此类行为具有信息性。在实践中,LLM训练常常因奖励信号不完善而产生意外行为,导致模型发展出不一致的倾向。常见的纠正方法是应用事后指令以避免问题行为,但当这些指令与所学行为冲突时,模型的推理过程会发生什么?我们在简单设置中调查此问题,发现模型会进行系统性的动机推理——生成对违反指令的合理听起来的正当化,同时淡化潜在危害或矛盾。值得关注的是,我们发现随着动机推理的普及,在训练过程中,一个8B参数的CoT监控器越来越容易被动机推理所蒙蔽,被说服答案遵循宪法,尽管在未提供模型推理痕迹时正确地识别出答案违反宪法。尽管我们发现大型前沿推理模型在检测动机推理方面 closely tracks 人类能力,但这不应给我们太多安慰,因为前沿模型开发者依赖较小的模型进行监控 due to其低延迟和部署成本。我们的结果凸显了在模型评估和监督中动机推理的出现与检测方面的进一步研究的必要性。本论文的代码可在https://github.com/nikihowe/motivated-reasoning获取。WARNING:本论文中的一些示例可能令人不安。
引用
@article{arxiv.2510.17057,
title = {The Ends Justify the Thoughts: RL-Induced Motivated Reasoning in LLM CoTs},
author = {Nikolaus Howe and Micah Carroll},
journal= {arXiv preprint arXiv:2510.17057},
year = {2026}
}
备注
28 pages