中文

理解代码代理行为:成功与失败轨迹的实证研究

网络与互联网体系结构 2025-11-04 v1

摘要

大型语言模型(LLM)代理在复杂软件工程任务中日益广泛部署,导致有必要理解其问题解决行为超越简单成功指标的需求。尽管这些代理在自动化问题解决方面展现出惊人的能力,但其决策过程仍然是大体上不可见的。本文对代理轨迹进行实证研究,即执行轨迹捕捉代理在尝试解决软件问题时采取的步骤。我们分析了来自三个最先进代码代理(OpenHands、SWE-agent 和 Prometheus)在SWE-Bench基准测试上的轨迹,既考察成功尝试,也考察失败尝试。我们的调查揭示了若干关键见解关于代理行为。首先,我们识别了不同问题解决策略(如防御式编程和情境收集)如何在不同情境下促成成功。其次,我们发现失败的轨迹始终比成功轨迹更长且更高方差,失败模式在代理之间存在显著差异。第三,我们的故障局部化分析显示,尽管大多数轨迹在故障情况下正确识别问题文件(72%-81%),但成功取决于实现近似而非精确的代码修改。这些发现及其他发现为通过轨迹分析理解代理行为提供了基础,为开发更稳健和可解释的自主软件工程系统做出贡献。

关键词

引用

@article{arxiv.2511.00196,
  title  = {Towards Sub-millisecond Latency and Guaranteed Bit Rates in 5G User Plane},
  author = {Leonardo Alberro and Noura Limam and Raouf Boutaba},
  journal= {arXiv preprint arXiv:2511.00196},
  year   = {2025}
}