ChromaFlow:工具增强智能体评估中编排开销的负向消融研究
人工智能
2026-05-20 v2
摘要
自主语言模型智能体日益将规划、工具使用、文档处理、浏览、代码执行和验证循环结合在一起。这些能力使智能体系统更加实用,但它们也引入了仅从最终准确率无法察觉的运行故障模式。本报告介绍了 ChromaFlow,这是一个围绕规划器主导执行、专用工具使用和遥测驱动评估构建的工具增强自主推理框架。我们在严格的评估约束下,在 GAIA 2023 Level-1 验证任务上对 ChromaFlow 进行了分析。冻结的完整 Level-1 基线获得了 29/53 的正确答案,即 54.72%。随后采用扩展编排的恢复配置获得了 27/53 的正确答案,即 50.94%,同时增加了回溯、超时事件、工具失败提及、token 日志调用和活动日志成本估算。两次随机的 20 任务冒烟评估分别产生了 12/20 和 11/20 的正确答案,表明微小的诊断增益在不同样本间可能是不稳定的。因此,核心结果是一个负向消融:更激进的编排并未提高完整集合的性能,反而增加了运行噪声。随后在严格的提供商下的完整 Level-1 诊断在明确的完整性控制下达到了 30/53,即 56.60%,但 token 日志成本大幅增加。本报告主张,有界的规划器升级、确定性提取、证据核对、提供商健康门控和显式运行门控应被视为可靠的自主智能体评估的一阶需求。
引用
@article{arxiv.2605.14102,
title = {ChromaFlow: A Negative Ablation Study of Orchestration Overhead in Tool-Augmented Agent Evaluation},
author = {Tarun Mittal},
journal= {arXiv preprint arXiv:2605.14102},
year = {2026}
}
备注
12 pages, 6 tables, 1 figure. Updated with follow-up strict-provider full-Level-1 diagnostic