中文

大规模预训练下用于文本分类的神经半监督学习

计算与语言 2020-11-20 v2

摘要

半监督学习的目标是利用无标签的域内数据集 U 来改进在标签数据集 D 上训练的模型。在大规模语言模型(LM)预训练背景下,我们如何最好地利用 U 仍知之甚少:在存在大规模预训练时半监督学习是否仍有益?U 应用于域内 LM 预训练还是伪标签生成?基于伪标签的半监督模型实际应如何实现?不同的半监督策略如何关于不同大小的 D、不同大小的 U 等影响性能。在本文中,我们在大规模 LM 预训练背景下对文本分类任务中的半监督学习进行了全面研究。我们的研究为半监督学习方法的行为提供了重要启示:(1)在 U 上存在域内预训练 LM 时,开放域 LM 预训练是不必要的;(2)域内预训练策略与基于伪标签的策略均带来显著性能提升,前者在更大 U 时表现更好,后者在更小 U 时表现更好,而二者结合带来最大性能提升;(3)自训练(先在伪标签 D' 上预训练再在 D 上微调)在 D 较小时产生更好性能,而在伪标签 D' 与原始数据集 D 的组合上联合训练在 D 较大时产生更好性能。使用半监督学习策略,我们仅用 IMDB 数据集上 50 个训练数据点便达到了约 93.8% 准确率,并在完整 IMDB 数据集上取得 96.6% 的竞争性性能。我们的工作标志着理解大规模预训练下半监督学习模型行为的初步一步。

关键词

引用

@article{arxiv.2011.08626,
  title  = {Neural Semi-supervised Learning for Text Classification Under Large-Scale Pretraining},
  author = {Zijun Sun and Chun Fan and Xiaofei Sun and Yuxian Meng and Fei Wu and Jiwei Li},
  journal= {arXiv preprint arXiv:2011.08626},
  year   = {2020}
}