中文

MixText:用于半监督文本分类的隐空间语言知情插值方法

计算与语言 2020-04-28 v1 机器学习

摘要

本文提出MixText,一种用于文本分类的半监督学习方法,其使用我们新设计的数据增强方法TMix。TMix通过在隐空间中对文本进行插值,创建大量增强训练样本。此外,我们利用数据增强的最新进展为无标签数据推测低熵标签,从而使其易于像有标签数据一样被使用。通过混合有标签、无标签与增强数据,MixText在多个文本分类基准上显著优于当前的预训练与微调模型以及其他最先进的半监督学习方法。在监督极其有限时,提升尤为显著。我们已在https://github.com/GT-SALT/MixText公开发布代码。

关键词

引用

@article{arxiv.2004.12239,
  title  = {MixText: Linguistically-Informed Interpolation of Hidden Space for Semi-Supervised Text Classification},
  author = {Jiaao Chen and Zichao Yang and Diyi Yang},
  journal= {arXiv preprint arXiv:2004.12239},
  year   = {2020}
}

备注

ACL 2020