中文

AuditRepairBench:面向 Agent 修复中评估器通道排名不稳定性的配对执行轨迹语料库

人工智能 2026-05-07 v1 软件工程

摘要

Agent 修复排行榜会在评估器重配置时发生重排,且可测量的部分重排是由在候选修复的内部选择期间参考评估器导出信号的方法所产生的。我们在公开排行榜上记录了这种失效模式,并发布了 AuditRepairBench,这是一个包含 576,000 个注册单元(96,000 个已执行)的配对执行轨迹语料库,它在声明的可观测性边界内将评估器通道阻断排名不稳定性操作化。一个模块化筛选架构通过四种可互换的实现来决定路径阻断:一个学习的影响代理、一个不使用训练模型的基于规则的通道暴露比率、一个反事实敏感性代理,以及一个稀疏的人工审核代理;它们组合成一个筛选后验,输入到单元级翻转泛函、集合值标签、分层系统评分和集合值排行榜中。该资源得到了基于机制的验证的支持:在一个 80 例的源级通道手术子集上,通过一项独立发现协议,两个与流水线开发者分离的标注组在不知晓筛选设计的情况下发现了耦合模式,且冻结的集成模型在其 79 个案例上取得了 0.83 的合并 AUROC;此外还包括实现鲁棒性、将 95% 覆盖率从 0.81 提高到 0.95 的不确定性传播,以及合并社区评估器 Spearman \r{ho} = 0.65 的前向迁移。筛选引导的盲化补丁在不到 50 行代码的情况下将排名位移减少了 55--74%(平均 62%),而随机通道盲化最多产生 7% 的减少,通用重训练最多产生 13% 的减少。AuditRepairBench-Lite 是一个在 12,000 个单元子集上的纯规则配置,在 24 个 GPU 小时内以 Kendall {\tau} = 0.88 保持排行榜,是 42 GB 的主要发布工件。

关键词

引用

@article{arxiv.2605.04624,
  title  = {AuditRepairBench: A Paired-Execution Trace Corpus for Evaluator-Channel Ranking Instability in Agent Repair},
  author = {Yuelin Hu and Zhenbo Yu and Zhengxue Cheng and Wei Liu and Li Song},
  journal= {arXiv preprint arXiv:2605.04624},
  year   = {2026}
}

备注

25 pages, 8 figures, NeurIPS 2026 Evaluation and D Directions Track