中文

基于子任务导向强化微调的问题解决框架 SoRFT

机器人学 2025-11-25 v2 机器学习 多智能体系统

摘要

主流问题解决框架依赖商业模型,导致高成本和隐私问题。现有的训练方法在问题解决方面存在泛化不足,无法充分利用开源开发资源。我们提出子任务导向强化微调(SoRFT),一种新的训练方法以增强大语言模型(LLM)的问题解决能力。我们将问题解决分解为结构化子任务:文件定位、函数定位、行定位和代码编辑生成。SoRFT 包含两个训练阶段:(1)基于拒绝抽样的监督式微调,使用基于真实答案的 Chain of Thought(CoT)数据进行过滤后进行微调;(2)基于规则的强化学习,利用基于真实答案的奖励机制采用 PPO。我们在 SWE-Bench Verified 和 SWE-Bench Lite 上评估了 SoRFT 训练的模型,在开源模型中实现了最先进(SOTA)性能(例如,使用 SoRFT-Qwen-7B 在 SWE-Bench Verified 上解决 21.4% 的问题)。实验结果表明,SoRFT 显著提升了问题解决性能,改进了模型泛化能力,提供了对商业模型的高性价比替代方案。

关键词

引用

@article{arxiv.2502.20125,
  title  = {Discovering Antagonists in Networks of Systems: Robot Deployment},
  author = {Ingeborg Wenger and Peter Eberhard and Henrik Ebel},
  journal= {arXiv preprint arXiv:2502.20125},
  year   = {2025}
}

备注

reduced file size