中文

野外评估代理型 AI:失效模式、漂移模式及生产评估框架

人工智能 2026-05-05 v1

摘要

现有针对大型语言模型的评估框架——包括 HELM、MT-Bench、AgentBench 和 BIG-bench——均设计用于受控、单次会话、实验室规模的环境。它们无法涵盖代理型 AI 系统在生产环境中持续运行时出现的评估挑战,包括决策错误的叠加效应、工具失效级联、非确定性输出漂移,以及长期任务缺乏真实答案的困境。本文作出三方面贡献:第一,提出了七种专为生产环境代理系统所设计的失效模式分类,基于在十亿级事件规模下运行的系统观察;第二,实证证明了标准指标(ROUGE、BERTScore、准确率/AUC 以及上述代理基准)在何处无法检测每种失效模式;第三,提出 PAEF(Production Agentic Evaluation Framework,即生产代理评估框架),一个包含五个维度的评估框架,并提供开源参考实现,旨在针对生产流量进行持续评估而非离线基准测试。我们的分析表明,标准指标完全未能检测四种失效模式,仅在多个评估周期后才间接检测到另外三种失效模式。

关键词

引用

@article{arxiv.2605.01604,
  title  = {Evaluating Agentic AI in the Wild: Failure Modes, Drift Patterns, and a Production Evaluation Framework},
  author = {Mukund Pandey},
  journal= {arXiv preprint arXiv:2605.01604},
  year   = {2026}
}

备注

11 pages, 6 tables, 1 figure. Reference implementation: https://github.com/mukund1985/llm-eval-toolkit