中文

面向语言模型的源代码注释预处理

软件工程 2022-08-30 v2 机器学习

摘要

注释是源代码的重要组成部分,也是文档的主要来源。这推动了利用大量注释来训练或评估消费或生成注释的工具的兴趣——例如从注释生成预言机乃至代码,或自动生成代码摘要。此类工作大多对注释的结构和质量做了强假设,例如假设其主要由规范的英文句子构成。然而,对于这些用例下现有注释的实际质量我们知之甚少。注释常包含其他文本类型中未见过的独特结构与元素,从中过滤或提取信息需要格外谨慎。本文探讨了从 GitHub 上 840 个最流行的开源项目以及 SriLab 数据集中的 8422 个项目抽取的 Python 注释的内容与质量,并研究了朴素过滤与深度过滤对将现有注释用于训练和评估注释生成系统的影响。

关键词

引用

@article{arxiv.2208.11235,
  title  = {Preprocessing Source Code Comments for Linguistic Models},
  author = {Sergey Matskevich and Colin S. Gordon},
  journal= {arXiv preprint arXiv:2208.11235},
  year   = {2022}
}

备注

Correcting author name