中文

用于文本分类的监督图对比预训练

计算与语言 2021-12-22 v1 机器学习

摘要

文本分类的对比预训练技术已在无监督设定下得到广泛研究。然而,来自与当前任务共享标签语义的相关任务的标注数据通常是可用的。我们假设有效利用这些标注数据可带来当前任务上更好的泛化能力。在本文中,我们提出一种新方法,通过基于图的监督对比学习方法来有效利用来自相关任务的标注数据。我们通过将样本中的监督信息外推至词元(token)来构建词元图。我们的构建方式产生了一个嵌入空间,其中属于同一类概率高/低的词元彼此邻近/疏远。我们还发展了详细的理论见解,作为我们方法的动机。在1313个数据集的实验中,我们表明我们的方法平均优于预训练方案2.5%2.5\%,也优于基于样本级对比学习的公式1.8%1.8\%。此外,我们展示了我们的方法在零样本设定下的跨域有效性,平均提升3.91%3.91\%。最后,我们还证明我们的方法可作为知识蒸馏设定中的噪声教师,在低标注数据条件下显著提升基于Transformer的模型性能,平均达4.57%4.57\%

关键词

引用

@article{arxiv.2112.11389,
  title  = {Supervised Graph Contrastive Pretraining for Text Classification},
  author = {Samujjwal Ghosh and Subhadeep Maji and Maunendra Sankar Desarkar},
  journal= {arXiv preprint arXiv:2112.11389},
  year   = {2021}
}

备注

A condensed version of this paper has been accepted to ACM SAC'22. DOI: https://doi.org/10.1145/3477314.3507194