SEAlign:面向软件工程代理的对齐训练
软件工程
2025-03-25 v1
摘要
近期的代码生成模型进展展现出在自动化软件开发任务中令人印象深刻的能力,但这些模型在实际软件工程场景中仍面临挑战。尽管当前的训练方法,特别是后训练方法,在解决竞赛编程问题方面表现出色,但未能充分准备模型以应对实际软件开发的复杂性。这一误差引发了关键问题:现有的对齐训练方法是否适用于实际的软件工程任务?在本研究中,我们识别了这一问题并提出 SEAlign,一种旨在弥合代码生成模型与实际软件开发任务之间差距的新型对齐框架。SEAlign 利用软件工程流程的独特特征,包括高质量的工作流程步骤,以提升模型能力。我们的框架进一步采用蒙特卡洛树搜索进行多步骤决策过程的精细对齐,随后对关键动作进行偏好优化,以确保模型满足实际要求。我们在三个用于实际软件工程的标准代理基准中评估了 SEAlign,包括 HumanEvalFix、SWE-Bench-Lite 和 SWE-Bench-Verified。实验结果显示,SEAlign 在最小训练开销下实现了最先进的性能。此外,我们开发了一个基于 SEAlign 的代理式软件开发平台,该平台成功自动化了几个小型应用程序的创建。对这些应用程序的人类评估突出了在任务性能和用户体验方面的显著改进。我们的发现凸显了 SEAlign 加速大型代码模型在实际软件开发中采用的潜力。我们相信,这一研究为实现完全自动化的软件工程迈出了重要一步。
引用
@article{arxiv.2503.18455,
title = {SEAlign: Alignment Training for Software Engineering Agent},
author = {Kechi Zhang and Huangzhao Zhang and Ge Li and Jinliang You and Jia Li and Yunfei Zhao and Zhi Jin},
journal= {arXiv preprint arXiv:2503.18455},
year = {2025}
}