PTM4Tag:利用预训练模型优化 Stack Overflow 帖子的标签推荐
软件工程
2022-05-12 v4
摘要
Stack Overflow 常被视为最具影响力的软件问答(SQA)网站,拥有数百万个与编程相关的问题和答案。标签在高效组织 Stack Overflow 内容方面起着关键作用,并对支持一系列站点操作(例如查询相关内容)至关重要。选择不当的标签常会引入额外的噪声和冗余,从而导致标签同义与标签爆炸问题。因此,亟需一种能够准确推荐高质量标签的自动化标签推荐技术,以缓解上述问题。受近期预训练语言模型(PTM)在自然语言处理(NLP)中成功的启发,我们提出 PTM4Tag,一种面向 Stack Overflow 帖子的标签推荐框架,其利用具有三元组架构的 PTM,以独立的语言模型对帖子的组成部分(即标题、描述和代码)进行建模。据我们所知,这是首项在 SQA 站点标签推荐任务中利用 PTM 的工作。我们基于五种流行的预训练模型(BERT、RoBERTa、ALBERT、CodeBERT 和 BERTOverflow)对 PTM4Tag 的性能进行了比较评估。结果表明,在 PTM4Tag 中利用软件工程(SE)领域特定的 PTM CodeBERT,在所考虑的五种 PTM 中取得了最佳性能,并且在平均 、 和 - 方面大幅优于最先进的深度学习(基于卷积神经网络)方法。我们进行了消融研究,以量化帖子各组成成分(标题、描述和代码片段)对 PTM4Tag 性能的贡献。结果表明,标题在预测最相关标签时最为重要,且利用所有成分可获得最佳性能。
引用
@article{arxiv.2203.10965,
title = {PTM4Tag: Sharpening Tag Recommendation of Stack Overflow Posts with Pre-trained Models},
author = {Junda He and Bowen Xu and Zhou Yang and DongGyun Han and Chengran Yang and David Lo},
journal= {arXiv preprint arXiv:2203.10965},
year = {2022}
}
备注
Accepted for Research Track ICPC 2022