野外学习:利用无标签数据有效调优预训练代码模型
软件工程
2024-01-11 v1
摘要
预训练代码模型最近在许多代码智能任务中取得了显著改进。这些模型首先在大规模无标签数据集上使用自监督学习以任务无关的方式进行预训练,然后在下游任务的有标签数据集上进行微调。然而,有标签数据集通常规模有限(即需要大量人力),这可能阻碍预训练代码模型在特定任务中的性能。为了缓解这个问题,一种可能的解决方案是通过伪标签在调优阶段利用大规模无标签数据。然而,直接使用伪标签数据会带来大量噪声,即不正确的标签,导致次优性能。如何有效利用有噪声的伪标签数据是一个具有挑战性且尚未充分探索的问题。在本文中,我们提出了一种名为HINT的新颖方法,通过更好地利用伪标签数据来改进预训练代码模型与大规模无标签数据集。HINT包括两个主要模块:混合伪标签数据选择和噪声容忍训练。在混合伪数据选择模块中,考虑到鲁棒性问题,除了通过训练损失直接衡量伪标签质量外,我们还进一步提出使用基于检索的方法来过滤低质量的伪标签数据。噪声容忍训练模块旨在通过使用噪声容忍损失函数训练模型以及正则化模型预测的一致性,进一步减轻伪标签中错误的影响。实验结果表明,HINT能够以任务特定的方式更好地利用那些无标签数据,并为预训练模型提供互补的好处,例如,在代码摘要、缺陷检测和断言生成上分别将最佳基线模型提高了15.33%、16.50%和8.98%。
引用
@article{arxiv.2401.01060,
title = {Learning in the Wild: Towards Leveraging Unlabeled Data for Effectively Tuning Pre-trained Code Models},
author = {Shuzheng Gao and Wenxin Mao and Cuiyun Gao and Li Li and Xing Hu and Xin Xia and Michael R. Lyu},
journal= {arXiv preprint arXiv:2401.01060},
year = {2024}
}
备注
Accepted by ICSE 2024