以文本为导向的数据增强提升源代码学习:一项实证研究
软件工程
2025-02-07 v2 人工智能
摘要
近期研究表明,源代码学习(将深度神经网络应用于各类软件工程任务)取得了显著进展。与其他基于DNN的领域类似,源代码学习同样需要海量高质量训练数据以支撑这些应用的成功。数据增强作为一种生成额外训练数据的技术,已广泛应用于其他领域(如计算机视觉)。然而,源代码学习领域现有的数据增强实践仅限于代码重构等保留语法的简单方法。本文考虑到源代码也可表示为文本数据,率先探讨了专为自然语言文本设计的数据增强方法在源代码学习场景中的有效性。为此,我们聚焦于代码分类任务,并在四个关键代码问题和四种DNN架构上开展全面实证研究,以评估25种数据增强方法的效果。结果表明,特定数据增强方法能为源代码学习带来更准确且鲁棒的模型。此外,我们发现即便数据增强方法轻微破坏源代码语法,仍具增益。
引用
@article{arxiv.2303.06808,
title = {Boosting Source Code Learning with Text-Oriented Data Augmentation: An Empirical Study},
author = {Zeming Dong and Qiang Hu and Yuejun Guo and Zhenya Zhang and Maxime Cordy and Mike Papadakis and Yves Le Traon and Jianjun Zhao},
journal= {arXiv preprint arXiv:2303.06808},
year = {2025}
}
备注
Accepted by Empirical Software Engineering (EMSE) 2025