利用复制增强的 CodeBERT 模型与双模态信息改进 Stack Overflow 问题标题生成
计算与语言
2022-08-26 v2 人工智能
编程语言
软件工程
摘要
背景:Stack Overflow 对寻求编程问题答案的软件开发人员非常有帮助。先前研究表明,越来越多的问题质量低下,从而较少获得潜在回答者的关注。Gao 等人提出了一种基于 LSTM 的模型(即 BiLSTM-CC),从代码片段自动生成问题标题以提升问题质量。然而,仅使用问题正文中的代码片段无法为标题生成提供充足信息,且 LSTM 无法捕捉词元间的长程依赖。目标:本文提出 CCBERT,一种基于深度学习的新型模型,通过充分利用整个问题正文的双模态信息来提升问题标题生成性能。方法:CCBERT 遵循编码器-解码器范式,使用 CodeBERT 将问题正文编码为隐藏表示,使用堆叠的 Transformer 解码器生成预测词元,并附加一个复制注意力层来细化输出分布。编码器与解码器均执行多头自注意力操作以更好地捕捉长程依赖。本文构建了一个包含约 200,000 条从 Stack Overflow 官方发布数据中筛选出的高质量问题的数据集,以验证 CCBERT 模型的有效性。结果:CCBERT 在数据集上优于所有基线模型。在仅含代码和低资源数据集上的实验显示了 CCBERT 的优越性,其性能下降更少。人工评估也显示了 CCBERT 在可读性与相关性标准方面的优异表现。
引用
@article{arxiv.2109.13073,
title = {Improving Stack Overflow question title generation with copying enhanced CodeBERT model and bi-modal information},
author = {Fengji Zhang and Xiao Yu and Jacky Keung and Fuyang Li and Zhiwen Xie and Zhen Yang and Caoyuan Ma and Zhimin Zhang},
journal= {arXiv preprint arXiv:2109.13073},
year = {2022}
}
备注
This is the accepted version by Information and Software Technology