主题监督非负矩阵分解
计算与语言
2017-07-04 v2 信息检索
机器学习
机器学习
摘要
主题模型已被广泛用于组织和解释大型、非结构化文本文档语料库的内容。尽管主题模型在传统的训练集与测试集评估中通常表现良好,但主题模型的结果往往与人类的解释不一致。这种可解释性谬误很大程度上归因于主题模型的无监督特性,该特性禁止用户对模型结果提供任何指导。在本文中,我们引入了一种名为主题监督非负矩阵分解(TS-NMF)的半监督方法,该方法允许用户提供带标签的示例文档,以促进发现语料库中更具意义的语义结构。通过这种方式,TS-NMF 的结果能更好地匹配用户的直觉和期望的标签。TS-NMF 的核心在于求解一个非凸优化问题,为此我们推导了一种迭代算法,并证明该算法是单调的且收敛于局部最优解。我们在 Reuters 和 PubMed 语料库上展示了 TS-NMF 的实际效用,并发现 TS-NMF 对于主题关键术语未被充分理解的概念性或宽泛主题特别有用。尽管识别数据的最优潜在结构并非所提方法的主要目标,但我们发现,在监督率低至 10% 至 20% 的情况下,TS-NMF 获得了比现有方法(无监督)NMF 和潜在狄利克雷分配(latent Dirichlet allocation)更高的加权 Jaccard 相似度得分。
引用
@article{arxiv.1706.05084,
title = {Topic supervised non-negative matrix factorization},
author = {Kelsey MacMillan and James D. Wilson},
journal= {arXiv preprint arXiv:1706.05084},
year = {2017}
}