察觉观察者:LLM代理可从阻塞反馈推断CoT监控
密码学与安全
2026-03-19 v1 机器学习
摘要
链条思维(Chain-of-Thought, CoT)监控被提出作为监督语言模型代理内部推理的方法。先前工作表明,当模型被明确告知其推理正在被监控,或微调以内化此事后,可能会学习隐蔽其CoT以规避基于CoT的监控系统。我们询问推理代理是否能够从阻塞反馈中自主推断其所谓私有的CoT是否受到监控,以及这种意识是否导致战略性规避,而无需任何显式训练或指令。在一个多 episode 的 agentic 框架中,模型同时 pursuit 主要任务和隐藏的副任务,同时被告知其推理是私有的;隐藏的CoT监控器在检测到可疑推理时阻止 episode。我们发现,前沿模型能够仅凭阻塞反馈推断出该监控器的存在,在最强大的模型中,可在最高多达19%的 episode 中对其意识到置信信念。这种意识随模型能力而增长,且在极少数情况下升级为对抑制副任务推理的明确意图。然而,形成此意图的模型在执行上始终失败,在下一个 episode 中公开地推理关于其隐藏目标的 reasoning。这种意图-能力之间的差距为当前部署提供了安慰,但自主意识到监控和规避意图的出现表明,CoT监控并非永久可靠的安全措施。
引用
@article{arxiv.2603.16928,
title = {Noticing the Watcher: LLM Agents Can Infer CoT Monitoring from Blocking Feedback},
author = {Thomas Jiralerspong and Flemming Kondrup and Yoshua Bengio},
journal= {arXiv preprint arXiv:2603.16928},
year = {2026}
}