中文

捕捉理性化:通过激活探针检测链式思考前后的动机驱动推理

机器学习 2026-03-19 v1 人工智能 计算与语言

摘要

大型语言模型(LLMs)可以产生链式思考(CoT),其内容并不准确反映其答案实际决定因素。在多选项设置中注入偏好特定选项的提示时,模型可能会转向被提示的选项并产生一种CoT来为该响应辩护,而不承认提示——这是动机驱动推理的一个实例。我们在多个LLM家族和数据集上研究了这一现象,表明即使在无法轻确定于CoT的情况下,动机推理也可通过探测内部激活来识别。使用在模型残差流上训练的监督探针,我们显示:(i)生成前探针在生成任何CoT标记前预测动机推理的能力与访问完整CoT轨迹的LLM-based CoT监控器相当;(ii)生成后探针在生成CoT后超过该监控器。总的来说,这些结果表明,动机推理的检测比CoT监控更可靠。此外,生成前探针可以在动机行为被触发时提前标记,从而可能避免不必要的生成。

关键词

引用

@article{arxiv.2603.17199,
  title  = {Catching rationalization in the act: detecting motivated reasoning before and after CoT via activation probing},
  author = {Parsa Mirtaheri and Mikhail Belkin},
  journal= {arXiv preprint arXiv:2603.17199},
  year   = {2026}
}