MESIA:理解并利用方法级注释的补充特性以实现自动注释生成
软件工程
2024-03-27 v1 人工智能
摘要
代码注释对开发者的程序理解至关重要。在理解和复用某个方法的场景中,开发者期望代码注释能提供超出方法签名的补充信息。然而,不同代码注释中此类补充信息的程度差异很大。本文中,我们唤起对方法级注释补充特性的关注,并提出一个名为 MESIA(平均补充信息量)的新指标,用于评估代码注释所能提供的补充信息程度。利用 MESIA 指标,我们在一个流行的代码注释数据集和三种常见类型的神经方法上进行了实验,以生成方法级注释。实验结果通过若干发现证明了我们所提工作的价值:(1) 小 MESIA 注释约占数据集的 20%,且大多仅属于 WHAT 注释类别。(2) 数据集中的大 MESIA 注释能够提供各种关键信息,但现有神经方法难以生成。(3) 通过减少训练集中小 MESIA 注释的比例,我们可以提升现有神经方法生成大 MESIA 注释的能力。(4) 重新训练的模型可以为小 MESIA 测试集中的方法生成传达关键有意义补充信息的大 MESIA 注释,但在评估中会获得较低的 BLEU 分数。这些发现表明,有了良好的训练数据,自动生成的注释有时甚至可以超越人工编写的参考注释,而缺乏合适的评估真值是未来自动注释生成工作需要解决的问题。
引用
@article{arxiv.2403.17357,
title = {MESIA: Understanding and Leveraging Supplementary Nature of Method-level Comments for Automatic Comment Generation},
author = {Xinglu Pan and Chenxiao Liu and Yanzhen Zou and Tao Xie and Bing Xie},
journal= {arXiv preprint arXiv:2403.17357},
year = {2024}
}
备注
In 32nd IEEE/ACM International Conference on Program Comprehension (ICPC'24)