Goldfish:面向350种语言的单语语言模型
计算与语言
2026-03-09 v2
摘要
对于许多低资源语言,唯一可用的语言模型是同时在多种语言上训练的大型多语模型。尽管在推理任务上表现最先进,但我们发现这些模型在许多语言的基本语法文本生成方面仍然存在困难。首先,使用 FLORES 困惑度作为评估指标,大型多语模型在许多语言上的表现不如二元模型(例如 XGLM 4.5B 中24%的语言;BLOOM 7.1B 中43%的语言)。其次,当我们仅用1GB或更少的数据训练仅有1.25亿参数的小型单语模型时,这些小型模型在困惑度和大规模多语法性基准测试上均优于大型多语模型。为了促进低资源语言建模的未来工作,我们发布了 Goldfish——一套为350种语言可比训练的小型单语语言模型套件,包含超过1,000个模型。这些模型代表了其中215种语言的首个公开可用的单语语言模型。
引用
@article{arxiv.2408.10441,
title = {Goldfish: Monolingual Language Models for 350 Languages},
author = {Tyler A. Chang and Catherine Arnett and Zhuowen Tu and Benjamin K. Bergen},
journal= {arXiv preprint arXiv:2408.10441},
year = {2026}
}
备注
LREC 2026