中文

SantaCoder:别去追求高星项目!

软件工程 2023-02-27 v2 人工智能 机器学习

摘要

BigCode 项目是一个开放科学协作项目,致力于负责任地开发用于代码的大型语言模型。本技术报告描述了该协作截至 2022 年 12 月的进展,概述了当前个人身份信息(PII)脱敏流水线的状态、为降低模型架构风险所进行的实验,以及针对训练数据更好预处理方法的调研实验。我们在 The Stack 的 Java、JavaScript 和 Python 子集上训练了 11 亿参数模型,并在 MultiPL-E 文本到代码基准上评估它们。我们发现,更激进的近重复过滤可进一步提升性能,且令人惊讶的是,从具有 5 个以上 GitHub 星标的仓库中选取文件会显著损害性能。尽管模型规模小得多,我们的最佳模型在 MultiPL-E 的 Java、JavaScript 和 Python 部分上的从左向右生成和填充任务中,均优于先前开源的多语言代码生成模型(InCoder-6.7B 和 CodeGen-Multi-2.7B)。所有模型均在 OpenRAIL 许可证下发布于 https://hf.co/bigcode。

关键词

引用

@article{arxiv.2301.03988,
  title  = {SantaCoder: don't reach for the stars!},
  author = {Loubna Ben Allal and Raymond Li and Denis Kocetkov and Chenghao Mou and Christopher Akiki and Carlos Munoz Ferrandis and Niklas Muennighoff and Mayank Mishra and Alex Gu and Manan Dey and Logesh Kumar Umapathi and Carolyn Jane Anderson and Yangtian Zi and Joel Lamy Poirier and Hailey Schoelkopf and Sergey Troshin and Dmitry Abulkhanov and Manuel Romero and Michael Lappert and Francesco De Toni and Bernardo García del Río and Qian Liu and Shamik Bose and Urvashi Bhattacharyya and Terry Yue Zhuo and Ian Yu and Paulo Villegas and Marco Zocca and Sourab Mangrulkar and David Lansky and Huu Nguyen and Danish Contractor and Luis Villa and Jia Li and Dzmitry Bahdanau and Yacine Jernite and Sean Hughes and Daniel Fried and Arjun Guha and Harm de Vries and Leandro von Werra},
  journal= {arXiv preprint arXiv:2301.03988},
  year   = {2023}
}