挖掘 Reddit 数据以获取新冠疫情期学生需求
软件工程
2023-07-27 v1
摘要
数据驱动的需求工程利用了网络上丰富且可公开访问的众包信息。通过纳入针对某软件产品提供的用户反馈(例如移动应用商店中的评论),这些方法有助于识别问题、修复缺陷以及实现变更请求。然而,仅依赖针对软件产品的用户反馈限制了获取全部需求的可能性,因为尽管用户对所遇到的问题、事件或挑战及其借助软件应对的情境拥有丰富经验,他们未必总能清晰理解自身对该软件的确切需要。在本研究中,我们提出一种需求获取思路的转变,侧重于收集与问题本身相关的反馈,而非仅依赖关于软件产品的反馈。我们针对某高等教育机构中新冠疫情期的学生需求开展案例研究。我们收集了疫情期间他们在 Reddit 上的交流内容,并采用多种机器学习和自然语言处理技术来识别需求语句。在使用 Naive Bayes 与 TF-IDF 对多种技术进行基准测试时,我们取得了 0.79 的 F 值。结果使我们相信,从关于问题的交流中挖掘需求是可行的。尽管我们呈现的是初步结果,我们设想未来这些需求能补充常规获取的需求,并有助于缩小需求缺口。
引用
@article{arxiv.2307.14212,
title = {Mining Reddit Data to Elicit Students' Requirements During COVID-19 Pandemic},
author = {Shadikur Rahman and Faiz Ahmed and Maleknaz Nayebi},
journal= {arXiv preprint arXiv:2307.14212},
year = {2023}
}
备注
Preprint