评估代码摘要技术:一种新度量与实证表征
软件工程
2023-12-27 v1
摘要
文献中提出了多种代码摘要技术,用于自动记录代码片段或函数。理想情况下,软件开发人员应参与评估生成摘要的质量。然而,在大多数情况下,研究人员依赖自动评估指标,如BLEU、ROUGE和METEOR。这些指标都基于相同的假设:生成摘要与开发人员编写的参考摘要之间的文本相似度越高,其质量越高。然而,这一假设存在两个不足:(i)参考摘要(例如通过挖掘软件仓库收集的代码注释)可能质量低下甚至过时;(ii)生成的摘要虽然使用了与参考摘要不同的措辞,但可能在语义上等价,因此仍然适合记录代码片段。在本文中,我们对不同类型指标在捕捉生成摘要质量方面的互补性进行了彻底的实证研究。此外,我们提出通过考虑一个新维度来解决现有指标的局限性,该维度捕捉生成摘要与所记录代码片段的语义对齐程度,独立于参考摘要。为此,我们提出了一种基于对比学习的新度量来捕捉上述方面。我们通过实证表明,包含这一新维度能够更有效地表示开发人员对自动生成摘要质量的评估。
引用
@article{arxiv.2312.15475,
title = {Evaluating Code Summarization Techniques: A New Metric and an Empirical Characterization},
author = {Antonio Mastropaolo and Matteo Ciniselli and Massimiliano Di Penta and Gabriele Bavota},
journal= {arXiv preprint arXiv:2312.15475},
year = {2023}
}