通过对比自监督进行数据高效预训练
计算与语言
2021-04-16 v4 机器学习
摘要
对于自然语言处理“文本到文本”任务,主流方法严重依赖在日益增大的“任务外部”数据上预训练大型自监督模型。从高资源预训练的迁移学习效果良好,但研究集中于具有极大数据与计算需求的设定,而无大规模“任务外部”预训练的高效低资源学习的潜力仍待充分探索。本工作中,我们针对资源高效学习的三个核心挑战进行评估。即我们分析:(1) 预训练数据()效率;(2) 零样本到少样本标签()效率;以及 (3) 长尾泛化,因为长尾保持已与算法公平性相关联,且尾部数据按定义是有限的。为应对这些挑战,我们提出一种数据与计算高效的自我监督对比文本编码器,在 60MB“任务内部”文本数据上预训练,并将其与在 160GB“任务外部”文本上预训练的 RoBERTa 比较。我们发现我们的方法优于 RoBERTa,同时预训练与微调时间仅为 RoBERTa 微调时间的 1/5。
引用
@article{arxiv.2010.01061,
title = {Data-Efficient Pretraining via Contrastive Self-Supervision},
author = {Nils Rethmeier and Isabelle Augenstein},
journal= {arXiv preprint arXiv:2010.01061},
year = {2021}
}
备注
Majorly reworked version. Comparison to a large-scale RoBERTa model added. Focus on learning efficiency comparison to self and RoBERTa