改进 Stack Overflow 中帖子答案集合的质量
软件工程
2020-06-02 v1 机器学习
摘要
诸如 Stack Overflow 之类的社区问答平台帮助广大用户在线解决其面临的难题。随着近年来这些社区 popularity 的增长,成员与帖子的数量均急剧上升。此外,由于用户背景、技能、专业知识和视角的多样性,每个问题可能获得不止一个答案。因此,关注点已转向生成那些对整体社区而言更具价值答案集合的帖子,而非仅旨在满足提问者个人的单一被采纳答案。如同任何普遍社区一样,Stack Overflow 上大量低质量帖子需要改进。我们称这些帖子为“欠缺型帖子”,并将其定义为:其问题尚无人回答,或可通过其他答案加以改进的问题所属帖子。本文提出一种方法,利用相关专家的帮助,自动化识别此类帖子并提升其答案集合。在 60 名参与者的协助下,我们通过考察 Stack Overflow 上发布的 3075 个问题的特征与其对更优答案集合的需求之间的关系,训练了一个分类模型来识别欠缺型帖子。随后,我们开发了一款名为 SOPI 的 Eclipse 插件,并将该预测模型集成于插件中,以将这些欠缺型帖子链接至相关开发者并协助他们改进答案集合。我们分别借助 10 名和 15 名工业界专家开发者,评估了插件的功能以及提交至 Stack Overflow 的答案所产生的影响。我们的结果表明,决策树(尤其是 J48)在预测欠缺型问题方面优于其他方法,其精确率为 0.945,召回率为 0.903。我们得出结论:我们的插件不仅帮助程序员更轻松地为 Stack Overflow 做出贡献,同时也提升了答案的质量。
引用
@article{arxiv.2006.00341,
title = {Improving Quality of a Post's Set of Answers in Stack Overflow},
author = {Mohammadrezar Tavakoli and Maliheh Izadi and Abbas Heydarnoori},
journal= {arXiv preprint arXiv:2006.00341},
year = {2020}
}
备注
Accepted at Euromicro DSD/SEAA 2020