中文

面向 LLM 赋能智能体系统的软件工程基准与解决方案综述

软件工程 2025-10-24 v3 计算与语言

摘要

大语言模型(LLMs)与软件工程的融合,推动了系统从传统基于规则的方式向能够解决复杂问题的自主智能体系统转变。然而,由于缺乏对基准与解决方案如何相互关联的全面理解,系统性进展受到阻碍。本综述通过提供对 LLM 驱动的软件工程的首次整体性分析来填补这一空白,揭示了评估方法学与解决方案范式。我们回顾了 150 余篇近期论文,并沿两个关键维度提出了一种分类体系:(1)解决方案,分为基于提示、基于微调和基于智能体三种范式;(2)基准,涵盖代码生成、翻译与修复等任务。我们的分析凸显了从简单提示工程到融合规划、推理、记忆机制与工具增强等能力的复杂智能体系统的演进。为将这一进展置于具体语境中,我们提出了一个统一的流水线,展示了从任务规约到交付物的工作流,并详细说明了不同解决方案范式如何应对不同复杂度级别。与以往仅聚焦于特定方面的综述不同,本工作将 50 余个基准与其对应的解决方案策略相关联,使研究者能够针对不同评估准则识别最优方法。我们还指出了关键的研究空白,并提出了未来方向,包括多智能体协作、自演化系统以及形式化验证的集成。本综述可作为推动 LLM 驱动软件工程发展的基础性指南。我们在 GitHub 上维护了一个持续更新所综述及相关论文的代码库:https://github.com/lisaGuojl/LLM-Agent-SE-Survey。

关键词

引用

@article{arxiv.2510.09721,
  title  = {A Comprehensive Survey on Benchmarks and Solutions in Software Engineering of LLM-Empowered Agentic System},
  author = {Jiale Guo and Suizhi Huang and Mei Li and Dong Huang and Xingsheng Chen and Regina Zhang and Zhijiang Guo and Han Yu and Siu-Ming Yiu and Pietro Lio and Kwok-Yan Lam},
  journal= {arXiv preprint arXiv:2510.09721},
  year   = {2025}
}

备注

22 pages