我们是否建于磐石之上?论数据预处理对代码摘要的重要性
软件工程
2022-10-18 v2
摘要
代码摘要,即给定代码生成有用注释的任务,长期以来备受关注。大多数现有代码摘要模型在广泛使用的代码注释基准数据集上训练和验证。然而,从真实世界项目构建的基准数据集的质量如何却鲜为人知。基准数据集是否如预期般良好?为弥补这一差距,我们开展系统性研究以评估并改进用于代码摘要任务的四个广泛使用的基准数据集的质量。首先,我们提出一种自动化代码-注释清洗工具,能够准确检测现有基准数据集中由不当数据预处理操作引起的噪声数据。随后,我们应用该工具基于检测到的噪声进一步评估四个基准数据集的数据质量。最后,我们进行对比实验以探究噪声数据对代码摘要模型性能的影响。结果表明,这些数据处理噪声广泛存在于所有四个基准数据集中,且去除这些噪声数据可显著提升代码摘要性能。我们相信这些发现与见解将有助于更好地理解代码摘要任务中的数据质量,并为相关研究与实践铺平道路。
引用
@article{arxiv.2207.05579,
title = {Are We Building on the Rock? On the Importance of Data Preprocessing for Code Summarization},
author = {Lin Shi and Fangwen Mu and Xiao Chen and Song Wang and Junjie Wang and Ye Yang and Ge Li and Xin Xia and Qing Wang},
journal= {arXiv preprint arXiv:2207.05579},
year = {2022}
}