用于半监督文本分类的变分预训练
计算与语言
2019-06-07 v1 机器学习
摘要
我们引入VAMPIRE,一种在数据与计算资源有限时用于有效文本分类的轻量预训练框架。我们在域内无标签数据上将一元文档模型预训练为变分自编码器,并将其内部状态用作下游分类器的特征。经验上,我们展示了在低资源设定下VAMPIRE相对于计算昂贵的上下文嵌入与其他流行半监督基线的相对优势。我们还发现,在有限监督下工作时,对域内数据微调对于从上下文嵌入获得尚可性能至关重要。我们随本文提供代码以预训练并在下游任务中使用VAMPIRE嵌入。
引用
@article{arxiv.1906.02242,
title = {Variational Pretraining for Semi-supervised Text Classification},
author = {Suchin Gururangan and Tam Dang and Dallas Card and Noah A. Smith},
journal= {arXiv preprint arXiv:1906.02242},
year = {2019}
}
备注
ACL 2019