面向代码注释分类的深度学习模型优化:解决类别不平衡问题
软件工程
2025-07-03 v1
摘要
开发人员依赖代码注释来记录工作、跟踪问题和理解源代码。因此,注释提供了关于开发人员对其代码理解程度的宝贵见解,并描述了编写周围代码的各种意图。最近的研究利用自然语言处理和深度学习对注释进行意图分类。然而,这些标记数据常常不平衡,导致模型性能不佳。本文研究不同的损失函数加权策略以缓解特定类的稀缺性。具体而言,通过超参数搜索微调各种基于 RoBERTa 的变压器模型以识别其最优参数配置。此外,我们针对类别不平衡问题,对变压器进行不同损失函数加权策略的微调。我们的做法在 NLBSE'25 工具比赛数据集上比 STACC 基准提高了 8.9 百分点平均 F1 分数,在 17 个案例中超过基准方法,提升幅度从 -5.0 到 38.2。源代码公开于 https://github.com/moritzmock/NLBSE2025。
引用
@article{arxiv.2501.15854,
title = {Optimizing Deep Learning Models to Address Class Imbalance in Code Comment Classification},
author = {Moritz Mock and Thomas Borsani and Giuseppe Di Fatta and Barbara Russo},
journal= {arXiv preprint arXiv:2501.15854},
year = {2025}
}