HPLT 3.0:面向LLM和MT的超大规模多语言资源。单语与双语数据、多语言评估与预训练模型
计算与语言
2026-04-21 v3
摘要
我们 presented 一个ongoing initiative,旨在为近200种语言提供开放的、超大规模的、高质量的且丰富标注的文本数据集。此数据集规模可达30万亿token,可能是目前规模最大的、可获得的多语言LLM预训练数据集合。这些数据集源自来自不同来源的网页抓取,配套有完整的、开源的文档选择管线:从网页档案中选择文档、从HTML中提取文本、识别噪声文本的语言、进行精确和近似去重、标注(包括但不限于语域标签、文本质量估计和个人可识别信息),以及最终选择和过滤。我们通过对比和分析统计、对24种语言的样本进行人工抽检,以及对在此数据上训练的各种语言模型架构进行端到端评估,报告了数据质量探测结果。对于多语言LLM评估,我们提供了为九种欧洲语言构建的全面基准集合,特别强调原生创建的任务、缓解提示敏感性的机制,以及对分数进行精细化和聚合的规范化。此外,我们训练和评估了一套57个单语encoder-decoder模型,以及一些单语GPT类参考模型。除了单语数据和模型,我们还 presents 来自该数据的超大规模平行文本集合,同时还 synthesized 通过机器翻译生成的新型平行语料库。
引用
@article{arxiv.2511.01066,
title = {HPLT 3.0: Very Large-Scale Multilingual Resources for LLMs and MT. Mono- and Bi-lingual Data, Multilingual Evaluation, and Pre-Trained Models},
author = {Stephan Oepen and Nikolay Arefev and Mikko Aulamo and Marta Bañón and Maja Buljan and Laurie Burchell and Lucas Charpentier and Pinzhen Chen and Mariya Fedorova and Ona de Gibert and Barry Haddow and Jan Hajič and Jindřich Helcl and Andrey Kutuzov and Veronika Laippala and Zihao Li and Risto Luukkonen and Bhavitvya Malik and Vladislav Mikhailov and Amanda Myntti and Dayyán O'Brien and Lucie Poláková and Sampo Pyysalo and Gema Ramírez Sánchez and Janine Siewert and Pavel Stepachev and Jörg Tiedemann and Teemu Vahtola and Dušan Variš and Fedor Vitiugin and Tea Vojtěchová and Jaume Zaragoza},
journal= {arXiv preprint arXiv:2511.01066},
year = {2026}
}