推理模型在控制其思考链方面存在挑战
人工智能
2026-03-09 v1
摘要
链式思维 (CoT) 监控是检测现代推理模型异常行为并理解其动机的有前景工具。然而,如果模型能够控制其 CoT 中的语言表述,可能削弱 CoT 可监控性。为衡量这种不良能力——CoT 可控性——我们引入了 CoT-Control 评估套件,包括需要模型遵守 CoT 指令解决问题的任务,例如在讨论遗传学问题时不使用单词 '染色体'。我们展示,推理模型的 CoT 可控性显著低于输出可控性;例如,Claude Sonnet 4.5 仅能在 2.7% 的情况下控制其 CoT,但在控制最终输出时为 61.9%。我们还发现 CoT 可控性随模型规模而提高,同时会随着更多 RL 训练、推理计算和问题难度的增加而降低。即使在模型被给予激励(而非直接请求)来规避 CoT 监控的情况下,CoT 可控性仍会出错,尽管在被告知正在监控时,模型表现出稍高的可控性。类似地,通过对抗性优化提示并无法显著提升可控性。我们的结果使我们对 CoT 可控性目前不太可能成为 CoT 可监控性的失效模式持审慎乐观态度。然而,低可控性背后的机制尚不清楚。鉴于其对维持 CoT 可监控性的重要性,我们建议前沿实验室在未来模型中跟踪 CoT 可控性。
引用
@article{arxiv.2603.05706,
title = {Reasoning Models Struggle to Control their Chains of Thought},
author = {Chen Yueh-Han and Robert McCarthy and Bruce W. Lee and He He and Ian Kivlichan and Bowen Baker and Micah Carroll and Tomek Korbak},
journal= {arXiv preprint arXiv:2603.05706},
year = {2026}
}