中文

面向软件元数据的生成式AI:FIRE 2023软件工程信息检索赛道综述

软件工程 2023-11-08 v1 人工智能 信息检索

摘要

软件工程信息检索(IRSE)赛道旨在基于人工与大型语言模型生成的标签,在机器学习框架下开发用于代码注释自动评估的解决方案。该赛道包含一个二分类任务,将注释分类为有用与无用。数据集由从开源github基于C的项目中提取的9048对代码注释及周围代码片段组成,以及各团队使用大型语言模型单独生成的附加数据集。来自多所大学和软件公司的17个团队共提交了56项实验。提交结果使用F1分数进行定量评估,并基于所开发特征的类型、所用的监督学习模型及其相应超参数进行定性评估。由大型语言模型生成的标签增加了预测模型的偏差,但带来了较少的过拟合结果。

关键词

引用

@article{arxiv.2311.03374,
  title  = {Generative AI for Software Metadata: Overview of the Information Retrieval in Software Engineering Track at FIRE 2023},
  author = {Srijoni Majumdar and Soumen Paul and Debjyoti Paul and Ayan Bandyopadhyay and Samiran Chattopadhyay and Partha Pratim Das and Paul D Clough and Prasenjit Majumder},
  journal= {arXiv preprint arXiv:2311.03374},
  year   = {2023}
}

备注

Overview Paper of the Information Retrieval of Software Engineering Track at the Forum for Information Retrieval, 2023