中文

弱监督神经文本分类

信息检索 2018-09-13 v2 计算与语言 机器学习 机器学习

摘要

深度神经网络因强大的表达能力和较少的特征工程需求,在经典文本分类任务中日益流行。尽管具有如此吸引力,神经文本分类模型在许多现实应用中受限于训练数据的缺乏。虽然存在许多半监督和弱监督文本分类模型,但它们不易应用于深度神经模型,且支持的监督类型有限。本文提出一种弱监督方法,解决神经文本分类中训练数据缺乏的问题。我们的方法包含两个模块:(1)伪文档生成器,利用种子信息生成伪标注文档用于模型预训练;(2)自训练模块,在真实无标注数据上自助法精炼模型。我们的方法具有处理不同类型弱监督的灵活性,并可轻松集成到现有的深度神经文本分类模型中。我们在来自不同领域的三个真实世界数据集上进行了大量实验。结果表明,所提方法在无需过多训练数据的情况下取得了令人鼓舞的性能,并显著优于基线方法。

关键词

引用

@article{arxiv.1809.01478,
  title  = {Weakly-Supervised Neural Text Classification},
  author = {Yu Meng and Jiaming Shen and Chao Zhang and Jiawei Han},
  journal= {arXiv preprint arXiv:1809.01478},
  year   = {2018}
}

备注

CIKM 2018 Full Paper