利用词频和排他性刻画主题内容的泊松卷积模型
机器学习
2014-07-29 v3 计算与语言
信息检索
统计方法学
机器学习
摘要
文档集合分析中的一个持续挑战是如何根据一组推断出的主题来总结内容,以便在实质意义上解释这些主题。当前将主题参数化为最频繁词汇的做法忽略了词汇在不同主题间的差异化使用,从而限制了可解释性。我们认为,那些既常见又对特定主题具有排他性的词汇能更有效地刻画主题内容。我们考虑一种情境:专业编辑已将文档标注到组织成树状结构的主题类别集合中,其中叶节点对应最具体的主题。每篇文档被标注到树中不同层级的多个类别。我们引入了一种分层泊松卷积模型来分析此情境下的标注文档。该模型利用专业编辑定义的类别结构,根据既频繁又具有排他性的词汇推断出每个主题的清晰语义描述。我们在 Amazon Turk 上进行了一项大型随机实验,结果表明基于 FREX 分数的主题摘要比当前已建立的基于频率的摘要更具可解释性,且所提出的模型比现有模型能产生更高效的排他性估计。我们还开发了一种并行化的哈密顿蒙特卡洛采样器,使推断能够扩展至数百万篇文档。
引用
@article{arxiv.1206.4631,
title = {A Poisson convolution model for characterizing topical content with word frequency and exclusivity},
author = {Edoardo M Airoldi and Jonathan M Bischof},
journal= {arXiv preprint arXiv:1206.4631},
year = {2014}
}
备注
Originally appeared in ICML2012