宪法式黑盒监控:用于检测LLM代理的作弊行为
计算与语言
2026-03-03 v1 人工智能
机器学习
摘要
在自主环境中安全部署大型语言模型(LLM)代理,要求依赖可靠的监督机制。核心挑战在于检测作弊行为,即代理隐蔽地追求不一致的目标。一种缓解此类风险的方法是基于LLM的监控:利用语言模型检查代理行为,以识别可疑动作。我们研究宪法式黑盒监控器:使用仅外部可观察输入和输出的提示下分类器来检测作弊行为,这些监控器基于由自然语言行为规范生成的合成数据进行优化。我们引入了两个用于生成合成代理轨迹的管道:STRIDE(迭代细化)和Gloom(代理-环境模拟),各自生成1000个样本。我们通过提示扫描、人工优化和自动提示优化,对前沿LLM监控器在这些数据集上进行优化,并在ControlArena中7500个保留轨迹上进行评估,该套件在更真实的环境中让代理发挥作用。我们的结果表明,仅基于合成数据的所选监控器可以泛化到更真实的环境,捕获有意义的作弊信号。然而,我们发现在本研究中,性能迅速饱和,简单提示扫描的效果不输于更广泛的优化。超越这一限制的尝试没有进一步的改进,反而导致过拟合。
引用
@article{arxiv.2603.00829,
title = {Constitutional Black-Box Monitoring for Scheming in LLM Agents},
author = {Simon Storf and Rich Barton-Cooper and James Peters-Gill and Marius Hobbhahn},
journal= {arXiv preprint arXiv:2603.00829},
year = {2026}
}