中文

VeRO:用于优化智能体的智能体评估工具

人工智能 2026-05-12 v3 计算与语言 机器学习

摘要

编码智能体的一个重要新兴应用是智能体优化:通过编辑-执行-评估循环对目标智能体进行迭代性改进。尽管此应用具有重要意义,但社区缺乏对该任务中编码智能体性能的系统性理解。智能体优化与传统软件工程不同:目标智能体将确定性代码与随机 LLM 完成交织在一起,需要结构化地捕获中间推理过程以及后续执行结果。为解决这些挑战,我们引入 VERO(Versioning, Rewards, and Observations),提供 (1) 具有版本化智能体快照、预算受控评估和结构化执行轨迹的可复现评估工具,以及 (2) 具有参考评估程序的目标智能体和任务基准套件。通过 VERO,我们进行经验研究,比较不同任务中的优化器配置,并分析哪些修改可靠地提高目标智能体性能。我们发布 VERO 以支持智能体优化作为编码智能体核心能力的研究。

关键词

引用

@article{arxiv.2602.22480,
  title  = {VeRO: An Evaluation Harness for Agents to Optimize Agents},
  author = {Varun Ursekar and Apaar Shanker and Veronica Chatrath and Yuan Xue and Sam Denton},
  journal= {arXiv preprint arXiv:2602.22480},
  year   = {2026}
}

备注

Accepted to the Forty-Third International Conference on Machine Learning (ICML), 2026