审计破坏基准: 用于检测和修复 ML 代码库研究破坏的基准
人工智能
2026-04-28 v2
摘要
随着 AI 系统越来越多地用于自主进行科研,偏离目标的系统可能引入细微缺陷,导致产生误导性结果且难以被检测到。我们引入 Auditing Sabotage Bench,这是一个用于评估审计员检测和修复 ML 研究代码库中破坏能力的基准。我们的基准包含 9 个 ML 研究代码库及其被破坏变体,后者会产生质量不同的实验结果。每次破坏都修改实现细节,如超参数、训练数据或评估代码,同时保留论文中描述的高层方法。我们对前沿 LLM 和 LLM 辅助的人类审计员进行了评估,发现两者都难以可靠地检测和修复破坏:最佳表现为 AUROC 为 0.77,由 Gemini 3.1 Pro 实现,top-1 修复率为 42%。我们还测试了 LLM 作为红队攻击者,发现 LLM 生成的破坏低于人类生成的破坏,但仍有时能规避同等能力的 LLM 审计员。我们发布该基准以支持监控和审计技术的研究,旨在促进 AI conducted research 的发展。
引用
@article{arxiv.2604.16286,
title = {Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases},
author = {Eric Gan and Aryan Bhatt and Buck Shlegeris and Julian Stastny and Vivek Hebbar},
journal= {arXiv preprint arXiv:2604.16286},
year = {2026}
}