当需要思维链时,语言模型难以规避监控
人工智能
2025-07-08 v1 计算与语言
摘要
尽管思维链监控是一种颇具吸引力的 AI 安全防御手段,但近期关于“不忠实性”的研究对其可靠性提出了质疑。这些发现揭示了一个重要的失效模式,特别是当 CoT 在偏见审计等应用中作为事后合理化时。然而,对于防止严重危害的运行时监控这一不同问题,我们认为关键属性并非忠实性而是可监控性。为此,我们引入了一个概念框架,以区分作为合理化的 CoT 与作为计算的 CoT。我们预期某些类别的严重危害将需要复杂的多步推理,从而必须使用作为计算的 CoT。我们复现了先前工作的实验设置,通过增加不良行为的难度来强制执行这一必要性条件;这迫使模型暴露其推理过程,使其变得可监控。随后,我们提出了方法论指南,以对 CoT 监控进行压力测试,以应对蓄意规避。应用这些指南,我们发现模型可以学会掩盖其意图,但前提是获得了大量帮助,例如详细的人工编写策略或针对监控器的迭代优化。我们得出结论:尽管 CoT 监控并非绝对可靠,但它提供了一层实质性的防御,需要积极保护并持续进行压力测试。
引用
@article{arxiv.2507.05246,
title = {When Chain of Thought is Necessary, Language Models Struggle to Evade Monitors},
author = {Scott Emmons and Erik Jenner and David K. Elson and Rif A. Saurous and Senthooran Rajamanoharan and Heng Chen and Irhum Shafkat and Rohin Shah},
journal= {arXiv preprint arXiv:2507.05246},
year = {2025}
}