中文

BYOL:将你自己的语言带入 LLMs

计算与语言 2026-01-19 v1

摘要

大型语言模型 (LLMs) 展现出强大的多语言能力,但仍然从根本上受到全球语言资源严重不平衡的制约。虽然全世界有超过 7,000 种语言在使用,但只有一小部分(不到 100 种)具有足够的数字存在感,能够对现代 LLM 训练产生实质性影响。这种差异导致了低资源与极低资源语言使用者的系统性表现不佳、文化错位和可访问性受限。为了解决这一差距,我们引入了“带来你自己的语言”(BYOL),这是一个统一的、可扩展的、语言感知的 LLM 开发框架,专为每种语言的数字足迹量身定制。BYOL 首先进行语言资源分类,使用精选的网络级语料库将语言划分为四个层级(极低、低、中、高),并利用该分类选择合适的集成路径。对于低资源语言,我们提出了一种全栈数据精炼与扩展流水线,结合了语料库清洗、合成文本生成、持续预训练和监督微调。将该流水线应用于 Chichewa 语和 Maori 语,生成的语言特定 LLMs 在 12 个基准测试中比强多语言基线平均提升了约 12%,同时通过权重空间模型合并保留了英语和多语言能力。对于极低资源语言,我们引入了翻译介导的包容路径,并在 Inuktitut 语上证明,定制的机器翻译系统比商业基线提高了 4 BLEU,从而在直接语言建模不可行时实现了高精度的 LLM 访问。最后,我们发布了 Chichewa 语、Maori 语和 Inuktitut 语版本的 Global MMLU-Lite 基准的人工翻译版本,并在 https://github.com/microsoft/byol 上公开了我们的代码库和模型。

关键词

引用

@article{arxiv.2601.10804,
  title  = {BYOL: Bring Your Own Language Into LLMs},
  author = {Syed Waqas Zamir and Wassim Hamidouche and Boulbaba Ben Amor and Luana Marotti and Inbal Becker-Reshef and Juan Lavista Ferres},
  journal= {arXiv preprint arXiv:2601.10804},
  year   = {2026}
}