Yuan 1.0:用于零样本与小样本学习的大规模预训练语言模型
计算与语言
2021-10-13 v2 人工智能
摘要
近期如 GPT-3 等工作通过扩大模型规模、数据集规模和计算量,在许多自然语言处理(NLP)任务上展示了零样本和小样本学习的优异性能。然而,训练像 GPT-3 这样的模型需要海量计算资源,这对研究者而言颇具挑战。本工作中,我们提出一种将大规模分布式训练性能纳入模型架构设计的方法。基于该方法,Yuan 1.0 作为当前最大的单体语言模型(含 245B 参数),在数千 GPU 上训练时取得优异性能,并在 NLP 任务上达到 SOTA 结果。我们设计了一种数据处理方法以高效过滤海量原始数据,并基于此构建了当前最大的高质量中文语料库,含 5TB 高质量文本。此外,提出一种校准与标签扩展方法以提升零样本和小样本性能,并在各类任务准确率上观察到稳定提升。Yuan 1.0 展现出强大的自然语言生成能力,所生成文章难以与人类撰写文章区分。
引用
@article{arxiv.2110.04725,
title = {Yuan 1.0: Large-Scale Pre-trained Language Model in Zero-Shot and Few-Shot Learning},
author = {Shaohua Wu and Xudong Zhao and Tong Yu and Rongguo Zhang and Chong Shen and Hongli Liu and Feng Li and Hong Zhu and Jiangang Luo and Liang Xu and Xuanwei Zhang},
journal= {arXiv preprint arXiv:2110.04725},
year = {2021}
}