探索代码分析大语言模型中的分布偏移
计算与语言
2023-12-07 v2 机器学习
软件工程
摘要
我们系统研究了三个具备代码能力的大语言模型——CodeT5、Codex与ChatGPT——如何泛化至域外数据。我们考虑两个基础应用:代码摘要与代码生成。我们依据数据的自然边界(按组织、按项目、以及按软件项目内的模块)将其划分为不同域。我们确认来自每个新域的样本均给所有模型带来显著的分布式偏移挑战。我们研究了既有方法如何使模型适应以更好地泛化至新域。实验表明,虽然多任务学习本身是一个合理的基线,但将其与从训练数据中检索示例的少样本微调相结合可获得极强性能。此外,该方案在极低数据场景下优于直接微调。最后,我们考虑该方法的若干变体以创建可更广泛适用的、一次性适应多域的方法。我们发现,对于代码生成,同时适应多域的模型性能与适应单域的模型相当。
引用
@article{arxiv.2303.09128,
title = {Exploring Distributional Shifts in Large Language Models for Code Analysis},
author = {Shushan Arakelyan and Rocktim Jyoti Das and Yi Mao and Xiang Ren},
journal= {arXiv preprint arXiv:2303.09128},
year = {2023}
}