Stack Overflow 中被遗忘问题预测的可行性研究
信息检索
2021-11-01 v1 计算与语言
机器学习
摘要
凭借其吸引力、全面性以及对相关主题的动态覆盖,诸如 Stack Overflow 之类的基于社区的问答网站严重依赖其社区的参与:随着技术的发展(以及社区成员积累相关经验),关于新技术、技术特性以及技术版本的问题不断出现并需要得到解答。与此同时,其他问题随时间推移重要性递减,最终对用户而言变得无关紧要。除了过滤低质量问题外,将已冗余的“被遗忘”问题进行清理,是保持 Stack Overflow 内容简洁有用的一个重要步骤。在本工作中,我们研究了 Stack Overflow 的这一受控遗忘任务。我们的工作基于该网站自身公开提供的超过十年(2008–2019)的数据,涵盖 1810 万条问题。为建立更深入的理解,我们首先分析并刻画了即将被遗忘的问题集合,即在当前时段获得相当数量浏览量但在不久的将来变得缺乏吸引力的问题。随后,我们考察了广泛特征在不同类别中预测此类被遗忘问题的能力。我们发现某些类别中这些问题更具可预测性。我们还发现,基于文本的特征在该预测任务中出人意料地并无帮助,而元信息则具有更强的预测力。
引用
@article{arxiv.2110.15789,
title = {On the Feasibility of Predicting Questions being Forgotten in Stack Overflow},
author = {Thi Huyen Nguyen and Tu Nguyen and Tuan-Anh Hoang and Claudia Niederée},
journal= {arXiv preprint arXiv:2110.15789},
year = {2021}
}