API引导的数据集合成以微调大型代码模型
软件工程
2024-08-23 v2 人工智能
摘要
大型代码模型(LCMs)在海量代码语料库上预训练,已在广泛的代码相关任务中展现出显著性能。监督微调(SFT)在将这些模型与特定需求对齐并提升其在特定领域的性能方面发挥着至关重要的作用。然而,合成高质量的SFT数据集面临重大挑战,原因在于数据集质量参差不齐以及领域特定数据集的稀缺。受API作为代码的高级抽象这一特性的启发——API以简洁的结构封装了丰富的语义信息——我们提出了DataScope,一个API引导的数据集合成框架,旨在增强LCMs在通用和领域特定场景下的SFT过程。DataScope包含两个主要组件:Dsel和Dgen。一方面,Dsel以API覆盖率作为核心指标,通过选择API覆盖率更高的现有(质量参差不齐的)数据集子集,实现通用场景下的高效数据集合成。另一方面,Dgen将领域数据集合成重构为使用API指定的高级功能和精心构建的代码骨架来合成具体代码的过程。大量实验证明了DataScope的有效性——在其合成数据集上微调的模型性能超越了在规模大五倍的未优化数据集上微调的模型。此外,对模型内部机制、相关超参数和案例研究的一系列分析进一步证明了所提方法的有效性。这些发现强调了数据集质量在SFT中的重要性,并通过提供一个高效、经济的框架来构建高质量数据集,推动了LCMs领域的发展。这一贡献提升了通用和领域特定场景下的性能,为更强大、更定制化的LCMs铺平了道路。
引用
@article{arxiv.2408.08343,
title = {API-guided Dataset Synthesis to Finetune Large Code Models},
author = {Zongjie Li and Daoyuan Wu and Shuai Wang and Zhendong Su},
journal= {arXiv preprint arXiv:2408.08343},
year = {2024}
}