更高效编码代理的回合控制策略实证研究
计算机视觉与模式识别
2025-10-21 v1
摘要
受 LLM 驱动的编码代理在迭代循环(回合)中解决软件工程任务方面日益增强的能力,但其实际部署受到显著且不可预测的成本的限制。这一挑战源于多个因素的组合:每次回合中代币数的平方增长、模型的高价、实际任务所需的大量回合,以及代理采取低效或不必要行动的倾向。虽然现有研究聚焦于优化单个回合,但对总回合数的战略控制在管理代理性能和成本方面仍属探索不足的领域。为填补这一空白,我们在 SWE-bench 上进行了全面实证研究,使用三个最先进的模型并评估了三种不同的回合控制策略:一种是无限制的基线、一种是带提醒的固定回合限制,以及一种创新的动态回合策略,该策略按需授予扩展。我们的发现首先揭示了在无限制设置下的基本权衡:没有单一模型在性能、成本和回合效率方面均能出类拔萃。我们进一步表明,固定回合限制(具体为基线的第 75 百分位)作为一种“甜点”位置,可显著降低成本(降低 24%-68%),而对解决率影响有限。最重要的是,动态回合策略持续优于固定限制方法,在实现相当或更好的解决率的同时,通过对仅需资源的任务进行智能分配,进一步降低成本 12%-24% 。本工作提供了回合控制策略的首个系统性分析,为开发人员提供简单而有效的指南,以平衡成本和效能。我们展示了动态资源分配是一种优越且易于实施的方法,用于部署强大且经济可行的编码代理。
引用
@article{arxiv.2510.16785,
title = {Segmentation as A Plug-and-Play Capability for Frozen Multimodal LLMs},
author = {Jiazhen Liu and Long Chen},
journal= {arXiv preprint arXiv:2510.16785},
year = {2025}
}