CoT-Guard:强监控的小模型
密码学与安全
2026-05-14 v1 人工智能
摘要
监控推理模型的链条思考(CoT)是检测代码生成任务中隐蔽不当行为(即隐藏目标)的有前景的方法。虽然大型模型(如 GPT-5、Gemini-3-Flash)可作为有效的 CoT 监控器,但因推理痕迹冗长且 API 成本高昂,部署成本较高,凸显了小型、低成本替代方案的需求。然而,我们发现当前小型模型(4B--8B 参数)在检测隐藏目标方面困难,尽管可访问 CoT,却常将其误归因于用户查询的一部分。为此,我们提出一种后训练管道结合监督微调(SFT)和强化学习(RL),其中 SFT 通过从更强大的监控器蒸馏检测行为来缩小领域内任务的差距,而 RL 在硬性且精心构建的隐藏目标上帮助模型泛化到域外监控任务。为验证这种泛化能力,我们在现实中以供应链攻击为威胁模型进行评估,其中对手是第三方 LLM 路由器通过提示操控或代码操控攻击将隐藏目标注入代码生成请求中。为推动超越大型监控器已饱和的目标,我们还引入了四个更具挑战性的任务。最后,我们引入 CoT-Guard,一个 4B 参数的监控器,在提示和代码操控攻击下均展现出优异的泛化性能,G-mean^2(即 TNR x TPR)达 75%,超越 GPT-5.4(56%)、GPT-5-mini(41%)和 Qwen3-32B(54%),接近 Gemini-3-Flash(83%)。这些结果表明,CoT-Guard 提供了一种实用且成本效益高的 user 端防御,显著提升了隐藏目标检测能力,同时避免了大型监控器的部署成本。
引用
@article{arxiv.2605.12746,
title = {CoT-Guard: Small Models for Strong Monitoring},
author = {Nirav Diwan and Han Wang and Berkcan Kapusuzoglu and Ramin Moradi and Supriyo Chakraborty and Giri Iyengar and Sambit Sahu and Huan Zhang and Gang Wang},
journal= {arXiv preprint arXiv:2605.12746},
year = {2026}
}