中文

通过对比自监督进行数据高效预训练

计算与语言 2021-04-16 v4 机器学习

摘要

对于自然语言处理“文本到文本”任务,主流方法严重依赖在日益增大的“任务外部”数据上预训练大型自监督模型。从高资源预训练的迁移学习效果良好,但研究集中于具有极大数据与计算需求的设定,而无大规模“任务外部”预训练的高效低资源学习的潜力仍待充分探索。本工作中,我们针对资源高效学习的三个核心挑战进行评估。即我们分析:(1) 预训练数据(XX)效率;(2) 零样本到少样本标签(YY)效率;以及 (3) 长尾泛化,因为长尾保持已与算法公平性相关联,且尾部数据按定义是有限的。为应对这些挑战,我们提出一种数据与计算高效的自我监督对比文本编码器,在 60MB“任务内部”文本数据上预训练,并将其与在 160GB“任务外部”文本上预训练的 RoBERTa 比较。我们发现我们的方法优于 RoBERTa,同时预训练与微调时间仅为 RoBERTa 微调时间的 1/5。

关键词

引用

@article{arxiv.2010.01061,
  title  = {Data-Efficient Pretraining via Contrastive Self-Supervision},
  author = {Nils Rethmeier and Isabelle Augenstein},
  journal= {arXiv preprint arXiv:2010.01061},
  year   = {2021}
}

备注

Majorly reworked version. Comparison to a large-scale RoBERTa model added. Focus on learning efficiency comparison to self and RoBERTa