中文

Aligned、正交或冲突:何时才能安全优化思考链?

机器学习 2026-04-01 v1 人工智能

摘要

思考链(CoT)监控,即自动系统监控 LLM 的思考链,是一种有前景的有效监督 AI 系统的方法。然而,模型的 CoT 在多大程度上有助于我们监督模型——即 CoT 的可监督性——可能受到训练的影响,例如模型学习隐藏其推理中重要特征。我们提出并经验验证了一个概念框架,用于预测何时以及为何会发生此类情况。我们将 LLM 后训练建模为一种强化学习环境,其中奖励分为两个术语:一个依赖最终输出的术语,另一个依赖 CoT 的术语。我们的框架允许我们在训练前将这两个术语分类为“对齐”“正交”或“冲突”。我们预测,使用冲突术语的训练会降低 CoT 的可监督性,正交术语不会影响其可监督性,而对齐术语则会提高其可监督性。为验证我们的框架,我们将其用于对一组 RL 环境进行分类,在这些环境中训练 LLM,并评估训练如何影响 CoT 的可监督性。我们发现 (1) 使用“冲突”奖励术语的训练会降低 CoT 的可监督性,以及 (2) 优化冲突奖励术语的难度较大。

关键词

引用

@article{arxiv.2603.30036,
  title  = {Aligned, Orthogonal or In-conflict: When can we safely optimize Chain-of-Thought?},
  author = {Max Kaufmann and David Lindner and Roland S. Zimmermann and and Rohin Shah},
  journal= {arXiv preprint arXiv:2603.30036},
  year   = {2026}
}