COCO-LM:用于语言模型预训练的文本序列纠错与对比
计算与语言
2021-10-28 v2 机器学习
摘要
我们提出一种自监督学习框架COCO-LM,通过纠正(COrrecting)与对比(COntrasting)受损文本序列来预训练语言模型。遵循ELECTRA风格的预训练,COCO-LM采用一个辅助语言模型来破坏文本序列,并基于此为主模型构建两个新的预训练任务。第一个词级任务,纠错语言建模(Corrective Language Modeling),是检测并纠正被辅助模型替换的词元,以更好地捕获词元级语义。第二个序列级任务,序列对比学习(Sequence Contrastive Learning),是对齐源自同一源输入的文本序列,同时确保表示空间中的均匀性。在GLUE与SQuAD上的实验表明,COCO-LM不仅在准确度上超越近期最先进的预训练模型,还提升了预训练效率。它以ELECTRA 50%的预训练GPU时长达到了ELECTRA的MNLI准确度。在标准base/large尺寸模型相同预训练步数下,COCO-LM以1+ GLUE平均点优于先前最佳模型。
引用
@article{arxiv.2102.08473,
title = {COCO-LM: Correcting and Contrasting Text Sequences for Language Model Pretraining},
author = {Yu Meng and Chenyan Xiong and Payal Bajaj and Saurabh Tiwary and Paul Bennett and Jiawei Han and Xia Song},
journal= {arXiv preprint arXiv:2102.08473},
year = {2021}
}
备注
NeurIPS 2021. (Code and Models: https://github.com/microsoft/COCO-LM)