中文

SWE-Fuse:通过无问题轨迹学习和熵感RLVR训练赋能软件代理

软件工程 2026-03-10 v1 人工智能

摘要

大型语言模型 (LLM) 已彻底变革了软件工程领域。最近develop出众多基于LLM的代理,用于解决实际的软件问题修复任务。尽管这些代理实现了最先进的性能,但面临一个显著挑战:\textbf{问题描述质量不足。}现实世界的数据集常常存在问题描述与其对应解决方案之间的偏差,这引入了噪声和模糊性,误导自动化代理并限制其问题解决效果。我们提出\textbf{\textit{SWE-Fuse}},一个具有问题描述意识的训练框架,通过融合问题描述引导和无问题样本用于训练SWE代理。它包含两个关键模块:(1) 基于无问题驱动的轨迹学习模块,用于缓解潜在误导性问题描述的影响,同时使模型能够学习逐步调试过程;(2) 基于熵的RLVR训练模块,通过熵驱动的裁剪自适应调整训练动态。在高熵情况下采用宽松裁剪以鼓励探索,在低熵情况下采用严格裁剪以确保训练稳定性。我们在广泛研究的SWE-bench Verified基准测试上评估了SWE-Fuse,展示了其在解决实际软件问题方面的有效性。具体而言,SWE-Fuse在解题率上分别比最好的8B和32B基线提高了43.0\%和60.2\%。此外,集成SWE-Fuse于测试时扩展 (TTS) 可进一步提升性能,在TTS@8下,8B和32B模型的解题率分别达到49.8\%和65.2\%。

关键词

引用

@article{arxiv.2603.07927,
  title  = {SWE-Fuse: Empowering Software Agents via Issue-free Trajectory Learning and Entropy-aware RLVR Training},
  author = {Xin-Cheng Wen and Binbin Chen and Haoxuan Lan and Hang Yu and Peng Di and Cuiyun Gao},
  journal= {arXiv preprint arXiv:2603.07927},
  year   = {2026}
}

备注

19 pages