输出监督会遮蔽思考链
机器学习
2025-11-18 v1 人工智能
密码学与安全
摘要
OpenAI(2025) 显示,针对链式思考(CoT)监视器进行训练会导致被遮蔽的 CoT,这些 CoT 包含监视器无法检测的恶意行为。他们提议仅针对不访问 CoT 的输出监视器进行训练,以保持 CoT 可监控性。我们表明,这种训练仍可通过两种机制导致被遮蔽的 CoT。首先,当模型被训练产生安全外观的输出时,该模型可能泛化到使其 CoT 看起来安全。其次,由于后续标记是条件于前者,安全外观的 CoT 可能增加安全输出的可能性,从而导致安全外观的 CoT 被强化。我们引入两种缓解措施来解决这两个问题,这些措施在常规训练的监控性和任务性能方面实现了帕累托改进。
引用
@article{arxiv.2511.11584,
title = {Output Supervision Can Obfuscate the Chain of Thought},
author = {Jacob Drori and Luke Marks and Bryce Woodworth and Alex Cloud and Alexander Matt Turner},
journal= {arXiv preprint arXiv:2511.11584},
year = {2025}
}