WarriorCoder:通过专家对决学习以增强代码大语言模型
计算与语言
2025-02-19 v3
摘要
尽管最近的编码大语言模型(LLM)取得了显著进展,但其惊人能力很大程度上依赖于在高质量数据上的微调,带来了数据收集和标注的挑战。为此,当前方法常设计各种数据飞轮,以收集复杂的代码指令,使模型能够处理更复杂的任务。然而,这些方法通常依赖现成数据集和来自有限套专有 LLM(如 Claude、GPT4 等)的数据增强,限制了所构建数据的多样性,并容易引发系统性偏见。本文提出 WarriorCoder,一种新型范式,通过专家对决来解决上述局限性。具体而言,我们构建了一个让顶尖专家代码 LLM 相互挑战的竞技场,由不偏不倚的裁判进行评估。这一竞争框架从头生成功绩数据,充分利用所有参与者的优势。实验结果表明,WarriorCoder 在相同规模的模型中实现了与之前模型相比的最先进性能,甚至无需依赖专有 LLM。
引用
@article{arxiv.2412.17395,
title = {WarriorCoder: Learning from Expert Battles to Augment Code Large Language Models},
author = {Huawen Feng and Pu Zhao and Qingfeng Sun and Can Xu and Fangkai Yang and Lu Wang and Qianli Ma and Qingwei Lin and Saravan Rajmohan and Dongmei Zhang and Qi Zhang},
journal= {arXiv preprint arXiv:2412.17395},
year = {2025}
}