CulturaX:一个面向167种语言大语言模型的清洗后海量多语言数据集
计算与语言
2023-09-19 v1 人工智能
摘要
具备惊人学习能力的的大语言模型(LLM)背后的驱动因素是其庞大的模型规模与广泛的训练数据集。随着自然语言处理的进步,LLM常被公开以促发更深入的研究与应用。然而,针对这些LLM的训练数据集,尤其是近期最先进模型所用者,往往未充分公开。打造高性能LLM的训练数据需经大量清洗与去重以确保必要质量。训练数据缺乏透明度因而阻碍了针对LLM幻觉与偏见问题的归因与解决研究,并妨碍社区的复现努力与进一步进展。这些挑战在多语言学习场景中尤为突出,现有多语言文本数据集常收集与清洗不当。因此,缺乏开源且即用的数据集来有效训练多语言LLM。为克服此问题,我们推出CulturaX——一个包含167种语言、6.3万亿token的庞大多语言数据集,专为LLM开发定制。我们的数据集经由含语言识别、基于URL的过滤、基于度量的清洗、文档精修与数据去重的多阶段严格流水线细致清洗与去重,以达最佳训练质量。CulturaX已在HuggingFace完全公开以促进多语言LLM研究:https://huggingface.co/datasets/uonlp/CulturaX。
引用
@article{arxiv.2309.09400,
title = {CulturaX: A Cleaned, Enormous, and Multilingual Dataset for Large Language Models in 167 Languages},
author = {Thuat Nguyen and Chien Van Nguyen and Viet Dac Lai and Hieu Man and Nghia Trung Ngo and Franck Dernoncourt and Ryan A. Rossi and Thien Huu Nguyen},
journal= {arXiv preprint arXiv:2309.09400},
year = {2023}
}
备注
Ongoing Work