SMOL:为 115 种资源不足语言 professionally 翻译的平行数据集
计算与语言
2025-11-03 v2
摘要
我们开源 SMOL(Set of Maximal Overall Leverage),这是一套用于解锁低资源语言机器翻译的训练数据。SMOL 被翻译成 124(持续增长中)种资源不足的语言(125 个语言对),包括许多此前无公开资源的语言,总计 610 万个翻译标记。SMOL 包含两个子数据集,每个子数据集都经过精心挑选,以其规模为最大影响力做出选择:SMOLSENT 包含为获得广泛唯一词汇覆盖而挑选的句子;SMOLDOC 侧重于文档级资源,关注广泛的话题覆盖。它们与已发布的 GATITOS 合并,形成段、句和标记三级内容的完整体系。我们表明使用 SMOL 对大语言模型进行提示或微调可实现稳健的 chrF 提升。除了翻译,我们为 SMOLDOC 中的所有文档提供事实性评估和依据,为大多数语言首次提供事实性数据集。
引用
@article{arxiv.2502.12301,
title = {SMOL: Professionally translated parallel data for 115 under-represented languages},
author = {Isaac Caswell and Elizabeth Nielsen and Jiaming Luo and Colin Cherry and Geza Kovacs and Hadar Shemtov and Partha Talukdar and Dinesh Tewari and Baba Mamadi Diane and Djibrila Diane and Solo Farabado Cissé and Koulako Moussa Doumbouya and Edoardo Ferrante and Alessandro Guasoni and Christopher Homan and Mamadou K. Keita and Sudhamoy DebBarma and Ali Kuzhuget and David Anugraha and Muhammad Ravi Shulthan Habibi and Genta Indra Winata and Anthony Munthali and Sina Ahmadi and Andrei Chemyshev and Mingfei Lau and Jonathan Eng},
journal= {arXiv preprint arXiv:2502.12301},
year = {2025}
}
备注
~10 pages with appendices