中文

基于词移距离的用户故事主题建模

计算与语言 2020-07-14 v2 信息检索

摘要

需求获取近来已辅以基于众包的技术,其持续地让大量异质用户群体通过多种媒介表达反馈。基于众包的获取在早期接触(潜在)用户方面潜力巨大,但也导致产生大量原始且非结构化的反馈。整合与分析此类反馈是将之转化为合理用户需求的关键挑战。本文关注主题建模,将其作为在大量众包生成用户故事中识别主题的手段,并比较三种方法:(1) 基于 Latent Dirichlet Allocation 的传统方法;(2) 词嵌入与主成分分析的结合;(3) 词嵌入与 Word Mover's Distance 的结合。我们在一个公开可用的、由众包工作者撰写并分类的 2,966 条用户故事集上评估这些方法。我们发现词嵌入与 Word Mover's Distance 的结合最具前景。依据我们在方法中使用的词嵌入不同,我们得以用两种方式对用户故事聚类:一种更贴近原始分类,另一种则能对数据集产生新见解,例如发现潜在的新类别。遗憾的是,目前不存在可客观评价我们结果质量的度量。尽管如此,我们的发现为未来分析众包用户故事的工作奠定了基础。

关键词

引用

@article{arxiv.2007.05302,
  title  = {Topic Modeling on User Stories using Word Mover's Distance},
  author = {Kim Julian Gülle and Nicholas Ford and Patrick Ebel and Florian Brokhausen and Andreas Vogelsang},
  journal= {arXiv preprint arXiv:2007.05302},
  year   = {2020}
}