仅靠基准测试是不够的:RAMP——生产系统中智能体模型的运行时评估
软件工程
2026-05-28 v1 人工智能
摘要
LLM 智能体正迅速从编码助手演变为自主软件工程系统。然而,现有的评估方法仍主要集中于静态、孤立和短时域的基准测试,未能捕捉到现实生产工作流的动态复杂性。因此,基准测试性能可能无法很好地反映在涉及长执行链、工具交互、依赖管理和迭代反馈循环的真实运行时环境下的实际能力。为此,我们提出 RAMP,一个用于评估长时域软件工程智能体的生产级基础设施。RAMP 构建于 YatCC 集成平台之上,通过标准化的编排和执行接口提供统一的运行时评估架构。RAMP 引入了具有串行依赖关系和复杂工具链交互的现实编译器构建工作负载,以及一个用于分析部分工作流失败时执行行为的分阶段恢复机制。该框架进一步整合了面向效用的多维指标,共同评估结果质量和过程效率。我们对 15 个主流模型进行了运行时评估,观察到传统孤立基准测试基本无法发现的显著能力退化。任务完成率在串行工作流中逐步崩溃,从初始阶段的 100% 下降到最终阶段的仅 20%,而没有一个被评估的模型成功完成整个流水线。运行时分析揭示了系统性的故障传播和显著的资源低效问题,在可比模型之间,计算成本差异高达三个数量级。这些发现表明,RAMP 将智能体模型评估推向持续、运行时可观测且基于生产环境的评估。
引用
@article{arxiv.2605.27492,
title = {Benchmarks are Not Enough: RAMP for Runtime Assessing of Agentic Models in Production Systems},
author = {Yipeng Ouyang and Xin Huang and Bingjie Liu and Zhongchun Zheng and Yuhao Gu and Xianwei Zhang},
journal= {arXiv preprint arXiv:2605.27492},
year = {2026}
}
备注
16 pages, 8 figures. Project homepage: http://ramp.yatcc-ai.com/