中文

宪法式黑盒监控:用于检测LLM代理的作弊行为

计算与语言 2026-03-03 v1 人工智能 机器学习

摘要

在自主环境中安全部署大型语言模型(LLM)代理,要求依赖可靠的监督机制。核心挑战在于检测作弊行为,即代理隐蔽地追求不一致的目标。一种缓解此类风险的方法是基于LLM的监控:利用语言模型检查代理行为,以识别可疑动作。我们研究宪法式黑盒监控器:使用仅外部可观察输入和输出的提示下分类器来检测作弊行为,这些监控器基于由自然语言行为规范生成的合成数据进行优化。我们引入了两个用于生成合成代理轨迹的管道:STRIDE(迭代细化)和Gloom(代理-环境模拟),各自生成1000个样本。我们通过提示扫描、人工优化和自动提示优化,对前沿LLM监控器在这些数据集上进行优化,并在ControlArena中7500个保留轨迹上进行评估,该套件在更真实的环境中让代理发挥作用。我们的结果表明,仅基于合成数据的所选监控器可以泛化到更真实的环境,捕获有意义的作弊信号。然而,我们发现在本研究中,性能迅速饱和,简单提示扫描的效果不输于更广泛的优化。超越这一限制的尝试没有进一步的改进,反而导致过拟合。

关键词

引用

@article{arxiv.2603.00829,
  title  = {Constitutional Black-Box Monitoring for Scheming in LLM Agents},
  author = {Simon Storf and Rich Barton-Cooper and James Peters-Gill and Marius Hobbhahn},
  journal= {arXiv preprint arXiv:2603.00829},
  year   = {2026}
}