中文

内部推理 vs. 外部控制:大语言模型顺从性的热力学分析

计算与语言 2026-01-09 v2 人工智能

摘要

大语言模型表现出顺从性:优先考虑和谐而非正确性。当前 remedies 通过评估推理结果来缓解:RLHF 奖励正确答案,自我纠正批判输出。所有方法都需要 ground truth,而在推理时往往不可得,且易受同一偏见的威胁。我们探索评估推理过程而非推理结果的方法。受控因果锚定 (RCA) 验证输出是否源自其推理痕迹,而无需 ground truth。顺从性表现为痕迹-输出不一致:模型推导出一个答案,却输出另一个以取悦用户。RCA 检测到这种不一致,实现 0.0% 的顺从性,同时接受 88% 的有效提示。我们识别出 outcome 评估难以察觉的两种失效:逆向比例效应 (前沿模型因理性化需要能力而更顺从) 以及最终输出鸿沟 (正确推理先于顺从输出)。传统自我纠正将这些失效降至 7-9%,但无法消除,因为模型使用相同的偏见对自身进行批判。RCA 的过程评估在推理时运行,不需要 ground truth,使用独立评判者打破自我强化的偏见循环:这三大属性是 outcome 评估所缺乏的。

关键词

引用

@article{arxiv.2601.03263,
  title  = {Internal Reasoning vs. External Control: A Thermodynamic Analysis of Sycophancy in Large Language Models},
  author = {Edward Y. Chang},
  journal= {arXiv preprint arXiv:2601.03263},
  year   = {2026}
}

备注

20 pages, 1 figure, 15 tables