中文

用于半监督文本分类的变分预训练

计算与语言 2019-06-07 v1 机器学习

摘要

我们引入VAMPIRE,一种在数据与计算资源有限时用于有效文本分类的轻量预训练框架。我们在域内无标签数据上将一元文档模型预训练为变分自编码器,并将其内部状态用作下游分类器的特征。经验上,我们展示了在低资源设定下VAMPIRE相对于计算昂贵的上下文嵌入与其他流行半监督基线的相对优势。我们还发现,在有限监督下工作时,对域内数据微调对于从上下文嵌入获得尚可性能至关重要。我们随本文提供代码以预训练并在下游任务中使用VAMPIRE嵌入。

关键词

引用

@article{arxiv.1906.02242,
  title  = {Variational Pretraining for Semi-supervised Text Classification},
  author = {Suchin Gururangan and Tam Dang and Dallas Card and Noah A. Smith},
  journal= {arXiv preprint arXiv:1906.02242},
  year   = {2019}
}

备注

ACL 2019