信息获取如何影响 LLM 监控器检测破坏行为的能力?
人工智能
2026-02-09 v2 软件工程
摘要
前沿语言模型代理可能 exhibit 误位行为,包括欺骗、利用奖励黑客以及追求隐藏目标。为了控制潜在误位的代理,我们可以利用 LLM 本身来监控异常行为。在本文中,我们研究信息获取如何影响 LLM 监控器性能。虽然一个人可能会期望监控器在获得被监控代理推理和行动的更多信息时表现更好,但我们发现当代系统往往在获取更少信息时表现更好,我们称之为自动监督的“少即是多”效应。我们展示了这一现象,并分析了其发生的条件,在三个评估环境中,代理必须在规避监控的同时进行破坏。利用这一效应,我们引入了提取-评估 (EaE) 监控——一种新的分层方法,其中一个监控器从被监控代理的轨迹中隔离相关摘录,另一个监控器对这些摘录进行评分。在 GPT-4.1-mini 监控器下的 BigCodeBench-Sabotage 中,EaE 将破坏检测率提高了 16.8 个百分点。 在其他设置中,EaE 要么超过基线,要么与基线持平。在此外,我们发现即使不知道自己正在被监控的代理更容易被抓住,并且对更长推理痕迹的监控器从信息过滤中获益更多。最后,我们进行了成本-性能分析,发现 Gemini 和 Claude 模型在涉及信息过滤的监控技术方面占据了 much of the Pareto 前沿。
引用
@article{arxiv.2601.21112,
title = {How does information access affect LLM monitors' ability to detect sabotage?},
author = {Rauno Arike and Raja Mehta Moreno and Rohan Subramani and Shubhorup Biswas and Francis Rhys Ward},
journal= {arXiv preprint arXiv:2601.21112},
year = {2026}
}
备注
54 pages, 34 figures, 7 tables