Stack Overflow答案中信息高亮的研究与推荐
计算与语言
2024-04-29 v3 信息检索
机器学习
软件工程
摘要
背景:导航Stack Overflow(SO)的知识仍然具有挑战性。为了使帖子对用户生动,SO允许用户使用Markdown或HTML编写和编辑帖子,以便用户可以利用各种格式样式(例如粗体、斜体和代码)来突出显示重要信息。然而,关于高亮信息的研究有限。目标:在我们最近的研究中,我们首次对SO答案中高亮的信息进行了大规模探索性研究。为了扩展我们之前的研究,我们开发了使用最初为命名实体识别任务设计的神经网络架构自动推荐带有格式样式的高亮内容的方法。方法:在本文中,我们研究了31,169,429个Stack Overflow答案。为了训练推荐模型,我们针对每种格式类型(即粗体、斜体、代码和标题)选择了基于CNN和基于BERT的模型,使用我们从SO答案收集的信息高亮数据集。结果:我们的模型在不同格式类型上的精确度在0.50到0.72之间。构建推荐代码的模型比其他类型更容易。文本格式类型(即标题、粗体和斜体)的模型召回率较低。我们对失败案例的分析表明,大多数失败案例是由于识别缺失。一种解释是模型容易学习频繁出现的高亮词,而难以学习较少出现的词(即长尾知识)。结论:我们的发现表明,开发用于在Stack Overflow上推荐不同格式样式答案的高亮信息的推荐模型是可能的。
引用
@article{arxiv.2401.01472,
title = {Studying and Recommending Information Highlighting in Stack Overflow Answers},
author = {Shahla Shaan Ahmed and Shaowei Wang and Yuan Tian and Tse-Hsun and Chen and Haoxiang Zhang},
journal= {arXiv preprint arXiv:2401.01472},
year = {2024}
}
备注
This work is submitted to Information and Software Technology Journal