中文

CoT 当场抓获:思维链监控的压力测试

人工智能 2025-11-26 v3 机器学习

摘要

随着 AI 模型被部署时具有越来越高的自主性,确保它们不会在未被察觉的情况下采取有害行动变得至关重要。作为一种可能的缓解措施,我们研究了思维链(CoT)监控,其中较弱的受信任监控模型持续监督更强大但不受信任的模型的中间推理步骤。我们在一个红队测试设置中将 CoT 监控与仅动作监控(仅审查最终输出)进行比较,其中不受信任的模型被指示在完成编码问题的同时追求有害的附带任务。我们发现,在仅动作监控无法可靠识别破坏的场景中,CoT 监控比仅监督模型输出更有效,但推理轨迹可能包含欺骗 CoT 监控器的误导性合理化,从而在明显的破坏案例中降低性能。为了解决这个问题,我们引入了一种混合协议,该协议对模型推理和动作独立评分,并使用加权平均将它们结合起来。我们的混合监控器在所有测试的模型和任务中均优于 CoT 监控器和仅动作监控器,在微妙的欺骗场景中检测率是仅动作监控的两倍。

关键词

引用

@article{arxiv.2505.23575,
  title  = {CoT Red-Handed: Stress Testing Chain-of-Thought Monitoring},
  author = {Benjamin Arnav and Pablo Bernabeu-Pérez and Nathan Helm-Burger and Tim Kostolansky and Hannes Whittingham and Mary Phuong},
  journal= {arXiv preprint arXiv:2505.23575},
  year   = {2025}
}

备注

To be published in the 39th Conference on Neural Information Processing Systems (NeurIPS 2025)