中文

代码理解模型背后的缩放定律

软件工程 2024-02-21 v1

摘要

缩放定律正成为许多机器学习领域的基本定律。也就是说,当增加训练数据、模型规模和计算资源时,测试误差呈幂律下降。然而,该定律是否适用于代码理解任务尚未得到充分研究,且当前大多数用于代码理解的语言模型约有 100M 参数,与大型语言模型相比相对“较小”。在本文中,我们通过改变训练数据、模型规模和计算资源进行了大量实验,以研究代码理解任务的缩放定律。我们验证了当使用更大模型时,代码理解模型的测试误差呈幂律下降,表明缩放定律适用于代码理解任务。此外,我们将不同规模的模型应用于两个下游代码理解任务,发现性能随模型规模的增大而提升。最后,我们利用更多计算资源在大规模数据集上训练了一个名为 CoLSBERT 的 1.5B 参数大规模代码理解模型,该模型以大幅优势超越了先前的工作。我们将在论文发表时发布我们的代码和 CoLSBERT 模型。

关键词

引用

@article{arxiv.2402.12813,
  title  = {Scaling Laws Behind Code Understanding Model},
  author = {Jiayi Lin and Hande Dong and Yutao Xie and Lei Zhang},
  journal= {arXiv preprint arXiv:2402.12813},
  year   = {2024}
}