中文

CommitBART:面向 GitHub 提交的大型预训练模型

软件工程 2023-01-24 v2 人工智能

摘要

GitHub 提交记录了带有自然语言描述信息的代码变更,对软件开发人员理解软件演化起着关键作用。为促进开源软件社区的发展,我们收集了一个包含 7 种编程语言逾 799 万条提交的提交基准。基于该基准,我们提出了 CommitBART,一个面向 GitHub 提交的大型预训练编码器-解码器 Transformer 模型。该模型通过三类(即去噪目标、跨模态生成与对比学习)共六项预训练任务进行预训练,以学习提交片段表示。此外,我们统一了一个包含一项理解任务与三项生成任务的“提交智能”框架用于提交处理。在这些任务上的综合实验表明,CommitBART 显著优于先前针对代码的预训练工作。进一步分析也揭示每项预训练任务均提升了模型性能。

关键词

引用

@article{arxiv.2208.08100,
  title  = {CommitBART: A Large Pre-trained Model for GitHub Commits},
  author = {Shangqing Liu and Yanzhou Li and Xiaofei Xie and Yang Liu},
  journal= {arXiv preprint arXiv:2208.08100},
  year   = {2023}
}