Training Deliberative Monitors for Black-Box Scheming Detection
摘要
随着自主智能体在实际任务中发挥更大能力,区分作恶行为与善意任务追求可能成为核心的人工智能控制问题。现有监控器往往依赖链路思考访问或内部激活,或使用提示的前沿模型,所有这些方法在部署时都可能不可用、不可靠或昂贵。本文研究仅基于动作的审慎监控器: smaller open-weight models trained to detect scheming and sabotage from agentic trajectories without accessing the monitored agent's reasoning or model internals. 受审慎对齐启发,我们的方法使用作恶规格说明从前沿教师中引导结构化理由,随后用单独的评判官过滤最高质量的理由,并通过监督微调和强化学习将其提炼到 open-weight monitors。我们在五个数据集上进行训练,并在六个超出分布的 agentic misalignment benchmark 中进行评估。我们表明,将本方法应用于 Qwen3.5-27B 可获得高于所有低成本前沿模型作为提示监控器(Gemini 3.1 Flash-Lite、GPT-5.4 Nano 和 Claude Haiku 4.5)的更好性能,同时也优于 Gemini 2.5 Pro,且实现更低的边际推理成本(按 token计费的每千次评估美元)。更强的提示前沿监控器(Gemini 3.1 Pro、GPT-5.4、Claude Sonnet 4.6 和 Claude Opus 4.6)实现了更好的性能,但大约高出 --的边际推理成本。我们训练的几个监控器在我们评估的监控器中位于经济-性能帕累托前沿,为实际低成本、低误报率的替代方案提供了可行性,取代提示的前沿模型。
引用
@article{arxiv.2605.29601,
title = {Training Deliberative Monitors for Black-Box Scheming Detection},
author = {Aditya Sinha and Akshat Naik and Victor Gillioz and Simon Storf and Kilian Merkelbach and Rich Barton-Cooper and Axel Højmark and Marius Hobbhahn},
journal= {arXiv preprint arXiv:2605.29601},
year = {2026}
}