MADLAD-400:一个多语言、文档级的大型审计数据集
计算与语言
2023-09-12 v1 机器学习
摘要
我们介绍了MADLAD-400,一个基于CommonCrawl的、经人工审计的通用领域3T词元单语数据集,涵盖419种语言。我们讨论了通过对MADLAD-400自行审计所揭示的局限性,以及数据审计在数据集创建过程中所起的作用。随后我们使用公开可用数据,在2500亿词元上(覆盖450余种语言)训练并发布了一个10.7B参数的多语言机器翻译模型,发现其可与显著更大的模型相竞争,并报告了在不同领域上的结果。此外,我们训练了一个8B参数的语言模型,并评估了其在少样本翻译上的结果。我们将基线模型提供给研究社区。
引用
@article{arxiv.2309.04662,
title = {MADLAD-400: A Multilingual And Document-Level Large Audited Dataset},
author = {Sneha Kudugunta and Isaac Caswell and Biao Zhang and Xavier Garcia and Christopher A. Choquette-Choo and Katherine Lee and Derrick Xin and Aditya Kusupati and Romi Stella and Ankur Bapna and Orhan Firat},
journal= {arXiv preprint arXiv:2309.04662},
year = {2023}
}
备注
Preprint