Mangosteen:面向语言模型预训练的开放泰语语料库
计算与语言
2025-07-23 v2
摘要
预训练数据影响语言模型的质量,但原始网页文本噪声较大,需要谨慎清洗。现有的大规模语料库依赖以英语为中心或语言中性的管道,其启发式方法不捕捉泰语脚本或文化细微差别,可能留下如赌博内容等风险材料未被处理。此前泰语专门化的努力定制管道或构建新管道,但很少公开数据或记录设计选择,阻碍了可重复性,也引出如何构建透明高质量泰语语料库的疑问。我们介绍 Mangosteen:一个由 470 亿 token 泰语语料库,通过泰语适配版 Dolma 管道构建,其中包括自定义规则语言识别、修订的 C4/Gopher 质量过滤器、泰语训练内容过滤器,以及来自维基百科、王室公报文本、OCR 提取的书籍和 CC 许可的 YouTube 字幕等精选非网页来源。通过使用 GPT-2 进行系统性消融实验,表明该管道在将 CommonCrawl 从 2000 万篇文档减少至 250 万篇的同时,将 SEA-HELM NLG 从 3 提升到 11;在 Mangosteen 上持续预训练 80 亿参数的 SEA-LION 模型,然后在泰语基准测试中超过 SEA-LION-v3 和 Llama-3.1 约四分之一。我们公开完整的管道代码、清洗清单、语料库快照以及所有模型检查点,为未来的泰语及区域语言模型研究提供了可重复的基础。
引用
@article{arxiv.2507.14664,
title = {Mangosteen: An Open Thai Corpus for Language Model Pretraining},
author = {Wannaphong Phatthiyaphaibun and Can Udomcharoenchaikit and Pakpoom Singkorapoom and Kunat Pipatanakul and Ekapol Chuangsuwanich and Peerat Limkonchotiwat and Sarana Nutanong},
journal= {arXiv preprint arXiv:2507.14664},
year = {2025}
}
备注
Work in Progress. All artifacts in this papers: https://huggingface.co/collections/aisingapore/wangchanlion-v3-687a362d8f0ea2fe4077c6b3