中文

Stack Overflow 帖子的表示学习:我们进展几何?

软件工程 2024-04-10 v2

摘要

Stack Overflow 的巨大成功积累了大量的软件工程知识语料,从而促使研究者提出各种方案来分析其内容。此类方案的性能在很大程度上取决于为 Stack Overflow 帖子所选的表示模型。随着关于 Stack Overflow 的文献数量持续激增,这凸显了对强大的 Stack Overflow 帖子表示模型的需求,并驱动研究者兴趣去开发能巧妙捕捉 Stack Overflow 帖子复杂性的专门表示模型。最先进的(SOTA)Stack Overflow 帖子表示模型是 Post2Vec 和 BERTOverflow,它们构建于卷积神经网络(CNN)和 Transformer 架构(如 BERT)等流行神经网络之上。尽管结果可观,这些表示方法尚未在同一实验设定下评估。为填补研究空白,我们首先在广泛的相关任务(即标签推荐、相关性预测和 API 推荐)中实证比较专为 Stack Overflow 帖子设计的表示模型(Post2Vec 和 BERTOverflow)的性能。为寻找更合适的帖子表示模型,我们进一步探索了多种基于 BERT 的模型,包括(1)通用领域语言模型(RoBERTa 和 Longformer)以及(2)用软件工程相关文本制品构建的语言模型(CodeBERT、GraphCodeBERT 和 seBERT)。然而,这也阐释了“没有银弹”的概念,因为没有任何模型能一致地胜过所有其他模型。受这些发现启发,我们提出 SOBERT,其采用简单而有效的策略,通过使用来自 Stack Overflow 的文本制品继续预训练阶段来改进性能最佳的模型。

关键词

引用

@article{arxiv.2303.06853,
  title  = {Representation Learning for Stack Overflow Posts: How Far are We?},
  author = {Junda He and Zhou Xin and Bowen Xu and Ting Zhang and Kisub Kim and Zhou Yang and Ferdian Thung and Ivana Irsan and David Lo},
  journal= {arXiv preprint arXiv:2303.06853},
  year   = {2024}
}