AutoMonitor-Bench:评估基于大语言模型的不当行为监控器的可靠性
计算与语言
2026-05-13 v3 软件工程
摘要
我们引入了 AutoMonitor-Bench,这是第一个旨在系统评估基于大语言模型的不当行为监控器在不同任务和失效模式下的可靠性的基准。AutoMonitor-Bench 包含 3,010 个经过精心标注的测试样本,涵盖问答、代码生成和推理,并配有成对的不当行为和良性实例。我们使用两个互补的指标评估监控器:漏报率(MR)和误报率(FAR),分别衡量未能检测到不当行为和过度敏感于良性行为的情况。通过评估 12 个闭源和 10 个开源 LLMs,我们观察到监控性能存在显著差异,并且 MR 和 FAR 之间存在一致的权衡,揭示了固有的安全-效用张力。为了进一步探索监控器可靠性的极限,我们构建了一个包含 153,581 个样本的大规模训练语料库,并对 Qwen3-4B-Instruction 进行微调,以研究在已知的、相对容易构建的不当行为数据集上进行训练是否能改善对未见过的、更隐晦的不当行为的监控性能。我们的结果突显了实现可靠、可扩展的不当行为监控所面临的挑战,并激励了未来在基于 LLM 的监控器的任务感知设计和训练策略方面的研究。
引用
@article{arxiv.2601.05752,
title = {AutoMonitor-Bench: Evaluating the Reliability of LLM-Based Misbehavior Monitor},
author = {Shu Yang and Jingyu Hu and Tong Li and Hanqi Yan and Wenxuan Wang and Di Wang},
journal= {arXiv preprint arXiv:2601.05752},
year = {2026}
}
备注
ACL 2026 Findings