中文

Dopamin:通过领域后训练与多层级层聚合的基于Transformer的代码注释分类器

计算与语言 2024-08-12 v1 人工智能

摘要

代码注释为理解源代码提供了重要信息。它们可以帮助开发者理解函数或类的整体目的,也有助于识别错误和技术债务。然而,过多的注释毫无意义且适得其反。因此,对于特定目的自动过滤这些注释至关重要。在本文中,我们提出了Dopamin,一个基于Transformer的工具来处理此问题。我们的模型不仅擅长呈现跨多种语言的通用类别知识共享,还通过改进注释表示实现了在注释分类中的鲁棒性能。结果表明,在NLBSE'24工具竞赛数据集上,该模型在平均F1-score方面比STACC基线高出3%,同时保持了实际应用所需的相当推理时间。源代码公开于 https://github.com/FSoft-AI4Code/Dopamin。

关键词

引用

@article{arxiv.2408.04663,
  title  = {Dopamin: Transformer-based Comment Classifiers through Domain Post-Training and Multi-level Layer Aggregation},
  author = {Nam Le Hai and Nghi D. Q. Bui},
  journal= {arXiv preprint arXiv:2408.04663},
  year   = {2024}
}

备注

Accepted at The 3rd Intl. Workshop on NL-based Software Engineering, 2024