中文

代理准确的失效预测并不等同于有效的失效预防

计算与语言 2026-02-04 v1 机器学习

摘要

LLM批评模型的主动干预常被假设为提高可靠性,但其在部署时的实际效果尚不为人知。我们展示,一个具有强离线准确性(AUROC 0.94)的二元LLM批评模型,仍可能导致严重的性能下降,在一个模型上导致26个百分点(pp)的崩溃,另一个模型几乎不受影响。这种变异性表明,LLM批评准确性本身不足以确定干预是否安全。我们识别出一种扰动-恢复权衡:干预可能在恢复失败轨迹方面有效,但也可能干扰本会成功的轨迹。基于此洞察,我们提出一种部署前测试,利用50个小型任务的样本来估计干预可能有帮助或有害,而无需完全部署。在基准测试中,该测试正确预测了结果:干预在高成功率任务上(0到-26 pp)降低性能,而在高失效ALFWorld基准上(+2.8 pp,p=0.014)获得适度改进。我们的框架的主要价值在于识别何时不要干预,从而在部署前防止严重的回归。

关键词

引用

@article{arxiv.2602.03338,
  title  = {Accurate Failure Prediction in Agents Does Not Imply Effective Failure Prevention},
  author = {Rakshith Vasudev and Melisa Russak and Dan Bikel and Waseem Alshikh},
  journal= {arXiv preprint arXiv:2602.03338},
  year   = {2026}
}