基于 BERT 与 Longformer 的代码注释不一致检测
计算与语言
2022-08-01 v1
摘要
注释,即源代码的自然语言描述,是软件开发者的标准实践。通过传达代码的功能与用法等重要方面,注释有助于软件项目维护。然而,当代码被修改而未相应更正注释时,注释与代码之间会出现不一致,这可能导致开发者困惑与缺陷。本文中,我们提出基于 BERT(Devlin 等,2019)与 Longformer(Beltagy 等,2020)的两个模型,在自然语言推理(NLI)语境下检测此类不一致。通过在先前建立的代码变更期间与之后注释-方法对语料库上的评估,我们证明我们的模型优于多个基线,并取得了与排除语言与词汇特征的最先进模型相当的结果。我们进一步讨论了使用预训练语言模型进行不一致检测与自动注释更新的未来研究思路。
引用
@article{arxiv.2207.14444,
title = {Code Comment Inconsistency Detection with BERT and Longformer},
author = {Theo Steiner and Rui Zhang},
journal= {arXiv preprint arXiv:2207.14444},
year = {2022}
}
备注
8 pages, 5 tables, 4 figures