中文

Merge-Bench:使用大语言模型解决合并冲突

机器学习 2026-05-26 v1

摘要

本文将机器学习应用于版本控制合并中的一个困难且重要任务。(1)我们构建了一个包含 7938 个来自 1439 个 GitHub 仓库的真实世界合并冲突 hunk 数据集。ground truth 为开发人员提交到仓库中的合并解决方案。我们的数据集构建方法具有可扩展性,无需人工标注即可处理任意数量的数据。(2)我们训练了一个名为 LLMergeJ 的模型,用于解决 Java 程序的合并冲突。我们的做法采用组相对策略优化(GRPO)——一种在线强化学习方法——训练大语言模型(LLM)。(3)我们对 LLMs 在解决合并冲突方面的性能进行了两项评估。在 Java 程序上,参数量为 14B 的 LLMergeJ 在 3 家商业 LLM 中表现优异,仅次于 Gemini 2.5 Pro。在 11 种编程语言中,商业 LLM 的性能基本保持稳定。最佳模型正确解决合并冲突的比例不足 60%。

关键词

引用

@article{arxiv.2605.25890,
  title  = {Merge-Bench: Resolve Merge Conflicts with Large Language Models},
  author = {Benedikt Schesch and Michael D. Ernst},
  journal= {arXiv preprint arXiv:2605.25890},
  year   = {2026}
}

备注

14 pages, 7 figures