中文

技能胜于规模:面向软件工程的中等规模领域特定模型的论证

计算与语言 2025-02-24 v3 软件工程

摘要

人工智能近期的进展引发了构建大型通用语言模型的趋势,这些模型可处理众多任务,包括许多与代码相关的任务。尽管这些模型训练成本高昂且常为闭源,但由于它们往往优于较小的代码领域特定模型,已得到广泛采用。在本文中,我们认为这并非既定结论。我们表明,只要训练标准相同,中等规模的领域特定模型在代码标注任务上可以优于大得多的模型。具体而言,我们聚焦于 StackOverflow(SO),其提供大量对齐的代码与文本数据。我们将预训练大语言模型的既有最佳实践与 SO 作为数据源的特性相对齐,特别是使用大上下文窗口(2048 个 token),配合强大的工具包(Megatron-LM)训练两个模型:SOBertBase(1.25 亿参数)和 SOBertLarge(7.62 亿参数),每个模型的预算仅分别为 374 美元和 1600 美元。我们将我们的模型与先前未采用诸多此类实践的领域特定模型(BERTOverflow),以及两个通用 BERT 模型和 OpenAI GPT 系列中的两个模型(GPT-3.5 和 GPT-4)进行性能比较。我们研究了四项标注任务:问题质量预测、已关闭问题预测、命名实体识别(NER)和废弃预测。最后一项任务是我们引入的新基准,我们额外在该任务上将 SOBert 与微调的 CodeLlama 和 StackLlama(参数规模为 SOBertLarge 的 10 倍)进行比较。我们的模型一致优于所有基线。相比之下,BertOverflow 在大多数任务中被通用模型超越。这些结果表明,在领域内数据上进行广泛且恰当的预训练,可提供一种强大且经济高效的替代方案,以替代使用闭源通用模型。两个模型均已在 Hugging Face 上公开发布。

关键词

引用

@article{arxiv.2306.03268,
  title  = {Skill over Scale: The Case for Medium, Domain-Specific Models for SE},
  author = {Manisha Mukherjee and Vincent J. Hellendoorn},
  journal= {arXiv preprint arXiv:2306.03268},
  year   = {2025}
}