CLUECorpus2020:用于语言模型预训练的大规模中文语料库
计算与语言
2020-03-06 v2
摘要
本文介绍来自 CLUE 组织的中文语料库 CLUECorpus2020,这是一个大规模语料库,可直接用于自监督学习,如语言模型的预训练或语言生成。其包含 100G 原始语料,共 350 亿中文字符,抓取自 Common Crawl。为更好地理解该语料库,我们在小规模和大规模上均进行了语言理解实验,结果表明在此语料库上训练的模型能在中文上取得优异性能。我们发布了一个大小为 8K 的新中文词表,仅为 Google 发布的中文 Bert 所用词表大小的三分之一。它在节省计算成本和内存的同时,表现与原始词表相当。我们还发布了基于此语料库的预训练模型的大型和微型版本。前者取得了当前最优(state-of-the-art)结果,后者在保留大部分精度的同时,相比 Bert-base 将训练和预测速度提升了八倍。为便利未来中文自监督学习的研究,我们在 Github 上发布了数据集、新词表、代码及预训练模型。
引用
@article{arxiv.2003.01355,
title = {CLUECorpus2020: A Large-scale Chinese Corpus for Pre-training Language Model},
author = {Liang Xu and Xuanwei Zhang and Qianqian Dong},
journal= {arXiv preprint arXiv:2003.01355},
year = {2020}
}
备注
8 pages, 9 tables