CATArena:通过迭代锦标赛评估代码代理的进化能力
人工智能
2026-02-02 v2 计算与语言
摘要
当前针对大型语言模型(LLM)代码代理的评估主要聚焦于单轮场景中生成功能性代码,无法评估代理在持续代码优化和多轮迭代开发方面的能力。为弥合这一差距,我们引入CATArena,一个通过迭代锦标赛评估代码代理进化能力的框架。代理参与多轮锦标赛,通过自我反思和同伴学习不断 refinement their code。对于评估,我们提出双重指标体系,以分离静态生成熟练程度与进化潜力。大量实验表明,代理的进化潜力并不严格与其初始熟练程度相关。我们的分析进一步揭示,当前代理在同时利用同伴学习和自我反思以实现有效性能提升方面存在挑战。此外,结果表明CATArena具有高度可扩展性和对variance任务的抗变能力,确立其作为持续可靠标准来评估LLM代码代理进化能力。
引用
@article{arxiv.2510.26852,
title = {CATArena: Evaluating Evolutionary Capabilities of Code Agents via Iterative Tournaments},
author = {Lingyue Fu and Xin Ding and Linyue Pan and Yaoming Zhu and Shao Zhang and Lin Qiu and Weiwen Liu and Weinan Zhang and Xuezhi Cao and Xunliang Cai and Jiaxin Ding and Yong Yu},
journal= {arXiv preprint arXiv:2510.26852},
year = {2026}
}