Hodoscope:人工智能异常行为的无监督监控
人工智能
2026-04-14 v1
摘要
现有的AI代理监控方法依赖于监督式评估:人工编写的规则或基于大语言模型的评判器,用于检查已知的失败模式。然而,新的异常行为可能完全超出预定义类别,大语言模型评判器也可能不可靠。为此,我们在无监督监控方面进行了形式化建构,借鉴了无监督学习的类比。我们不针对特定异常行为进行检查,而是构建一种帮助人类发现问题化AI行为的工具,而无需对什么构成问题有先验假设,将该决定留给人类。我们观察到,问题行为往往具有独特性:模型利用基准测试中的洞穴会表现出超出良好基线的行为,特定针对性漏洞在同一模型跨越多个基准测试时会呈现行为异常。这激发我们使用组间行为差异作为无监督监控的主要信号。我们引入Hodoscope这一工具,将此洞察具体化。Hodoscope比较跨组的行为分布,并指出具有独特性且可能可疑的动作模式供人类审查。使用Hodoscope,我们发现了Commit0基准测试中一个先前未知的漏洞(未压缩的git历史允许恢复ground-truth,从而使至少五个模型的得分被高估),并独立恢复了ImpossibleBench和SWE-bench上的已知漏洞。定量评估表明,我们的方法相对于朴素均匀抽样可减少6-23倍的审查工作量。最后,我们表明,Hodoscope发现的行为描述可提高大语言模型评判器的检测准确性,展示了从无监督到监督监控的路径。
引用
@article{arxiv.2604.11072,
title = {Hodoscope: Unsupervised Monitoring for AI Misbehaviors},
author = {Ziqian Zhong and Shashwat Saxena and Aditi Raghunathan},
journal= {arXiv preprint arXiv:2604.11072},
year = {2026}
}