Dopamin:通过领域后训练与多层级层聚合的基于Transformer的代码注释分类器
计算与语言
2024-08-12 v1 人工智能
摘要
代码注释为理解源代码提供了重要信息。它们可以帮助开发者理解函数或类的整体目的,也有助于识别错误和技术债务。然而,过多的注释毫无意义且适得其反。因此,对于特定目的自动过滤这些注释至关重要。在本文中,我们提出了Dopamin,一个基于Transformer的工具来处理此问题。我们的模型不仅擅长呈现跨多种语言的通用类别知识共享,还通过改进注释表示实现了在注释分类中的鲁棒性能。结果表明,在NLBSE'24工具竞赛数据集上,该模型在平均F1-score方面比STACC基线高出3%,同时保持了实际应用所需的相当推理时间。源代码公开于 https://github.com/FSoft-AI4Code/Dopamin。
引用
@article{arxiv.2408.04663,
title = {Dopamin: Transformer-based Comment Classifiers through Domain Post-Training and Multi-level Layer Aggregation},
author = {Nam Le Hai and Nghi D. Q. Bui},
journal= {arXiv preprint arXiv:2408.04663},
year = {2024}
}
备注
Accepted at The 3rd Intl. Workshop on NL-based Software Engineering, 2024