野外评估代理型 AI:失效模式、漂移模式及生产评估框架
人工智能
2026-05-05 v1
摘要
现有针对大型语言模型的评估框架——包括 HELM、MT-Bench、AgentBench 和 BIG-bench——均设计用于受控、单次会话、实验室规模的环境。它们无法涵盖代理型 AI 系统在生产环境中持续运行时出现的评估挑战,包括决策错误的叠加效应、工具失效级联、非确定性输出漂移,以及长期任务缺乏真实答案的困境。本文作出三方面贡献:第一,提出了七种专为生产环境代理系统所设计的失效模式分类,基于在十亿级事件规模下运行的系统观察;第二,实证证明了标准指标(ROUGE、BERTScore、准确率/AUC 以及上述代理基准)在何处无法检测每种失效模式;第三,提出 PAEF(Production Agentic Evaluation Framework,即生产代理评估框架),一个包含五个维度的评估框架,并提供开源参考实现,旨在针对生产流量进行持续评估而非离线基准测试。我们的分析表明,标准指标完全未能检测四种失效模式,仅在多个评估周期后才间接检测到另外三种失效模式。
引用
@article{arxiv.2605.01604,
title = {Evaluating Agentic AI in the Wild: Failure Modes, Drift Patterns, and a Production Evaluation Framework},
author = {Mukund Pandey},
journal= {arXiv preprint arXiv:2605.01604},
year = {2026}
}
备注
11 pages, 6 tables, 1 figure. Reference implementation: https://github.com/mukund1985/llm-eval-toolkit