中文

重排序词项以提升自动生成主题的的可解释性

计算与语言 2019-04-01 v1 信息检索

摘要

主题模型,如 LDA,在自然语言处理中被广泛使用。使其输出具有可解释性是一个重要的研究领域,在增强探索性搜索界面和可解释机器学习模型开发等方面有应用。传统上,主题由其 n 个最可能词表示,然而这些表示常难以被人解释。本文探索对主题词进行重排序以生成更具可解释性的主题表示。一系列方法在两个实验中被比较和评估。第一个实验使用众包工作者将不同词排序所表示的主题与相关文档关联起来。第二个实验是一种基于应用于多领域的文档检索任务的自动方法。两个实验的结果均表明重排序词项改善了主题可解释性,且最有效的重排序方案是那些结合了词项在主题内重要性及其在整个语料库中相对频率信息的方法。此外,两种评估方法结果间的密切相关性表明,此处提出的自动方法可用于评估重排序方法而无需人工判断。

关键词

引用

@article{arxiv.1903.12542,
  title  = {Re-Ranking Words to Improve Interpretability of Automatically Generated Topics},
  author = {Areej Alokaili and Nikolaos Aletras and Mark Stevenson},
  journal= {arXiv preprint arXiv:1903.12542},
  year   = {2019}
}

备注

Paper accepted for publication at IWCS 2019