基于生成式AI的数据增强对软件元数据分类影响的研究
软件工程
2023-10-24 v1 人工智能
计算与语言
机器学习
摘要
本文介绍了印度理工学院(ISM)丹巴德分校团队在FIRE IRSE 2023共享任务1(代码-注释对自动有用性预测)中提交的系统,以及大语言模型(LLM)生成数据对面向关联源代码的基础原始数据的影响。我们开发了一个框架,利用注释及其对应代码的神经上下文表示训练基于机器学习的模型,以预测代码-注释对的有用性,并将LLM生成数据与基础数据进行性能分析。在官方评估中,我们的系统F1分数较基线提升了4%,并体现了生成数据的质量。
引用
@article{arxiv.2310.13714,
title = {A study of the impact of generative AI-based data augmentation on software metadata classification},
author = {Tripti Kumari and Chakali Sai Charan and Ayan Das},
journal= {arXiv preprint arXiv:2310.13714},
year = {2023}
}