中文

UniMax:面向大规模多语言预训练的更公平且更有效的语言采样

计算与语言 2023-04-19 v1

摘要

预训练的多语言大语言模型通常使用基于启发式温度的采样来平衡不同语言间的比例。然而,先前工作尚未系统评估不同预训练语言分布在不同模型规模下的效能。本文中,我们提出一种新的采样方法UniMax,通过对每种语言语料的重复次数显式设上限,在提供更均匀的头部语言覆盖的同时缓解对尾部语言的过拟合。我们执行了一系列广泛的消融实验,在多语言基准套件上测试一系列采样策略,并改变模型规模。我们发现UniMax优于标准基于温度的采样,且收益随规模增大而持续。作为贡献的一部分,我们发布:(i) 一个改进并刷新的mC4多语言语料,包含107种语言共29万亿字符;(ii) 一套采用UniMax采样训练的umT5模型预训练检查点。

关键词

引用

@article{arxiv.2304.09151,
  title  = {UniMax: Fairer and more Effective Language Sampling for Large-Scale Multilingual Pretraining},
  author = {Hyung Won Chung and Noah Constant and Xavier Garcia and Adam Roberts and Yi Tay and Sharan Narang and Orhan Firat},
  journal= {arXiv preprint arXiv:2304.09151},
  year   = {2023}
}