中文

DolphCoder:通过多样化与多目标指令微调实现代码大语言模型的回声定位

计算与语言 2024-02-15 v1 人工智能

摘要

代码大语言模型(Code LLMs)在代码相关任务中已展现出卓越性能。目前已提出多种指令微调方法来提升预训练代码大语言模型的代码生成能力。本文提出一种用于代码生成的多样化指令模型(DolphCoder),该模型具备自我评估能力。它学习多样化的指令目标,并结合代码评估目标来增强其代码生成能力。我们的模型在 HumanEval 和 MBPP 基准测试上取得了优越性能,为未来的代码指令微调工作提供了新见解。我们的主要发现是:(1)通过增加具有不同推理路径的更多样化响应,可提升大语言模型的代码能力。(2)提升模型评估代码解决方案正确性的能力,也能增强其创建代码解决方案的能力。

关键词

引用

@article{arxiv.2402.09136,
  title  = {DolphCoder: Echo-Locating Code Large Language Models with Diverse and Multi-Objective Instruction Tuning},
  author = {Yejie Wang and Keqing He and Guanting Dong and Pei Wang and Weihao Zeng and Muxi Diao and Yutao Mou and Mengdi Zhang and Jingang Wang and Xunliang Cai and Weiran Xu},
  journal= {arXiv preprint arXiv:2402.09136},
  year   = {2024}
}

备注

14 pages, 6 figures