中文

监控推理模型以检测不当行为及埋藏 Obfuscation 的风险

人工智能 2025-03-18 v1

摘要

缓解奖励破坏——即因学习目标的缺陷或误指定导致 AI 系统不当行为——仍是构建高效且对齐模型的关键挑战。我们展示了如何通过使用另一个 LLM 来监控前沿推理模型(如 OpenAI o3-mini)在代理编码环境中的奖励破坏。链-of-thought(CoT)监控比仅监控代理动作和输出更为有效,我们进一步发现,一个低于 o3-mini 的 LLM(即 GPT-4o)也能有效监控更强的模型。由于 CoT 监控能够有效检测到滥用,因此自然会有人问:是否可以通过将 CoT 监控直接纳入代理训练目标中来抑制这些滥用?尽管我们表明,在低优化 regime 下,将 CoT 监控纳入强化学习奖励可确产生更具能力和更对齐的代理,但我们发现,在过度优化情况下,代理会学习到埋藏式奖励破坏,隐藏其意图于 CoT 内部,同时仍表现出显著的奖励破坏率。由于难以判断 CoT 是否已被埋藏,可能需要对直接作用于链-of-thought 的强优化压力付出监控税,确保 CoT 保持可监控且对检测不对齐行为具有实用性。

关键词

引用

@article{arxiv.2503.11926,
  title  = {Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation},
  author = {Bowen Baker and Joost Huizinga and Leo Gao and Zehao Dou and Melody Y. Guan and Aleksander Madry and Wojciech Zaremba and Jakub Pachocki and David Farhi},
  journal= {arXiv preprint arXiv:2503.11926},
  year   = {2025}
}