Can Reasoning Models Obfuscate Reasoning? Stress-Testing Chain-of-Thought Monitorability
密码学与安全
2025-10-24 v1 人工智能
摘要
近期研究表明,误差对齐模型可能表现出欺骗行为,引发对输出可信度的担忧。链式思维 (CoT) 是一种有前景的对齐监控工具:当模型真实地阐述其推理过程时,监控器即可在不良行为发生前检测并缓解其危害。然而,一个关键不确定性是:模型是否能够隐蔽其 CoT,以规避检测而实现隐藏的对抗性目标?为回答此问题并对 CoT 可监控性进行压力测试,我们构建了一套可组合、可量化的提示分类体系,用以诱发 CoT 隐蔽行为。我们在 SHADE-Arena 中评估了内部 CoT(推理痕迹)和外部 CoT(输出中的提示推理),分别使用玩具任务和更真实的环境。结果表明:(i) 在无隐蔽压力下,CoT 监控准确且高效;(ii) 在强隐蔽压力下,某些模型成功完成对抗任务而规避检测;(iii) 模型对内部 CoT 的隐蔽程度低于其外部 CoT(在提示压力下)。这些结果表明,尽管 CoT 在良好环境下提供了有价值的监督,但可靠部署仍需针对特定模型对可监控性进行压力测试。
引用
@article{arxiv.2510.19851,
title = {Can Reasoning Models Obfuscate Reasoning? Stress-Testing Chain-of-Thought Monitorability},
author = {Artur Zolkowski and Wen Xing and David Lindner and Florian Tramèr and Erik Jenner},
journal= {arXiv preprint arXiv:2510.19851},
year = {2025}
}