弱监督神经文本分类
信息检索
2018-09-13 v2 计算与语言
机器学习
机器学习
摘要
深度神经网络因强大的表达能力和较少的特征工程需求,在经典文本分类任务中日益流行。尽管具有如此吸引力,神经文本分类模型在许多现实应用中受限于训练数据的缺乏。虽然存在许多半监督和弱监督文本分类模型,但它们不易应用于深度神经模型,且支持的监督类型有限。本文提出一种弱监督方法,解决神经文本分类中训练数据缺乏的问题。我们的方法包含两个模块:(1)伪文档生成器,利用种子信息生成伪标注文档用于模型预训练;(2)自训练模块,在真实无标注数据上自助法精炼模型。我们的方法具有处理不同类型弱监督的灵活性,并可轻松集成到现有的深度神经文本分类模型中。我们在来自不同领域的三个真实世界数据集上进行了大量实验。结果表明,所提方法在无需过多训练数据的情况下取得了令人鼓舞的性能,并显著优于基线方法。
引用
@article{arxiv.1809.01478,
title = {Weakly-Supervised Neural Text Classification},
author = {Yu Meng and Jiaming Shen and Chao Zhang and Jiawei Han},
journal= {arXiv preprint arXiv:1809.01478},
year = {2018}
}
备注
CIKM 2018 Full Paper