基于主题建模的无标签数据多标签文本分类
信息检索
2017-11-07 v1 计算与语言
摘要
人工标注文档繁琐且昂贵,但却是训练传统文本分类器所必需的。近年来,已提出若干无标签数据文本分类技术以解决此问题。然而,现有工作主要集中于单标签分类问题,即每篇文档被限制仅属于单一类别。本文中,我们提出了一种新颖的种子引导多标签主题模型,名为 SMTM。借助与每类相关的少量种子词,SMTM 在没有任何标注文档的情况下对文档集合进行多标签分类。在 SMTM 中,每个类别关联一个覆盖该类别语义的单一类别-主题。为适应多标签文档,我们通过使用 spike and slab 先验与弱平滑先验在 SMTM 中显式建模类别稀疏性。即,无需任何阈值调优,SMTM 自动为每个文档选取相关类别。为融入种子词的监督信息,我们提出了一种种子引导的偏置 GPU(即广义 Polya urn)采样过程以引导 SMTM 的主题推断。在两个公开数据集上的实验表明,SMTM 取得了优于最先进替代方法的分类准确率,并在某些场景下甚至超越有监督方案。
引用
@article{arxiv.1711.01563,
title = {Multi-label Dataless Text Classification with Topic Modeling},
author = {Daochen Zha and Chenliang Li},
journal= {arXiv preprint arXiv:1711.01563},
year = {2017}
}