利用生成式AI:通过生成的代码-注释对改进软件元数据分类
软件工程
2023-11-08 v1 人工智能
计算与语言
机器学习
摘要
在软件开发中,代码注释对增强代码理解与协作至关重要。本研究论文解决了将代码注释客观分类为“有用”或“无用”的挑战。我们提出了一种利用上下文嵌入(尤其是BERT)来自动化该分类过程的新方案。我们通过引入生成的代码与注释对来处理此任务。初始数据集包含9048对用C语言编写、标注为有用或无用的代码与注释。为扩充该数据集,我们额外获取了739行代码-注释对,并使用大型语言模型架构(具体为BERT)生成标签。主要目标是构建能够有效区分有用与无用代码注释的分类模型。采用了多种机器学习算法,包括逻辑回归、决策树、K近邻(KNN)、支持向量机(SVM)、梯度提升、随机森林和神经网络。每种算法均使用精确率、召回率和F1分数指标进行评估,评估基于原始种子数据集和扩充数据集。本研究展示了生成式AI在增强二元代码注释质量分类模型方面的潜力,为自然语言处理和软件工程领域的软件开发者和研究者提供了有价值的见解。
引用
@article{arxiv.2311.03365,
title = {Leveraging Generative AI: Improving Software Metadata Classification with Generated Code-Comment Pairs},
author = {Samah Syed and Angel Deborah S},
journal= {arXiv preprint arXiv:2311.03365},
year = {2023}
}
备注
9 pages, 2 figures, 3 tables, Has been accepted for the Information Retrieval in Software Engineering track at Forum for Information Retrieval Evaluation 2023