中文

面向文本分类的自监督正则化

计算与语言 2021-03-25 v2 机器学习

摘要

文本分类是被广泛研究的问题且具有广泛应用。在许多现实问题中,用于训练分类模型的文本数量有限,使得这些模型易于过拟合。为解决此问题,我们提出 SSL-Reg,一种基于自监督学习(SSL)的数据依赖正则化方法。SSL 是一种无监督学习方法,其在输入数据上定义辅助任务而不使用任何人工提供的标签,并通过解决这些辅助任务学习数据表示。在 SSL-Reg 中,有监督分类任务与无监督 SSL 任务同时执行。SSL 任务是无监督的,纯定义于输入文本而不使用任何人工提供的标签。使用 SSL 任务训练模型可防止模型过拟合到分类任务中有限数量的类标签。在 17 个文本分类数据集上的实验证明了我们提出方法的有效性。

关键词

引用

@article{arxiv.2103.05231,
  title  = {Self-supervised Regularization for Text Classification},
  author = {Meng Zhou and Zechen Li and Pengtao Xie},
  journal= {arXiv preprint arXiv:2103.05231},
  year   = {2021}
}

备注

16 pages, 3 figures, to be published in Transactions of the Association for Computational Linguistics