中文

融合提示微调与先验知识的提交分类方法

软件工程 2023-10-27 v2

摘要

提交分类(Commit Classification, CC)是软件维护中的一项重要任务,因为它帮助软件开发人员根据其性质与目的将代码变更分类为不同类型。这使他们能更好地理解开发工作的进展,识别需要改进的方面。然而,现有方法均为判别模型,通常具有复杂架构,需要额外的输出层来产生类别标签概率。此外,它们需要大量标注数据用于微调,且在标注数据有限的情况下难以学习有效的分类边界。为解决上述问题,我们提出一种生成式框架,即融合提示微调与先验知识的提交分类(Incorporating prompt-tuning for commit classification with prior knowledge, IPCK)https://github.com/AppleMax1992/IPCK,其简化了模型结构并跨任务学习特征。它仅用有限样本仍可达 SOTA 性能。首先,我们提出基于 T5 的生成式框架。该编码器-解码器构建方法将不同 CC 任务统一为 text2text 问题,通过无需额外输出层简化了模型结构。其次,我们设计了一种提示微调(prompt-tuning)方案以替代微调,可在仅有限样本的少样本场景中采用。此外,我们通过外部知识图谱融入先验知识,在语音机器步骤中将词概率映射至最终标签,以提升少样本场景下的性能。在两个公开数据集上的大量实验表明,我们的框架能在少样本与零样本场景中简单而有效地解决 CC 问题,同时提升模型适应性,无需大量训练样本进行微调。

关键词

引用

@article{arxiv.2308.10576,
  title  = {Incorprating Prompt tuning for Commit classification with prior Knowledge},
  author = {Jiajun Tong and Xiaobin Rui},
  journal= {arXiv preprint arXiv:2308.10576},
  year   = {2023}
}