中文

像素语言模型的多语言预训练

计算与语言 2025-12-03 v2 人工智能

摘要

像素语言模型直接在渲染文本的图像上运行,消除了对固定词汇表的需求。尽管这些模型在下游跨语言迁移方面展示了强大的能力,但多语言预训练仍未被充分探索。我们引入了 PIXEL-M4,这是一个在四种视觉和语言上具有多样性的语言上进行预训练的模型:英语、印地语、乌克兰语和简体中文。在语义和句法任务上的多语言评估表明,PIXEL-M4 在非拉丁文字系统上优于纯英语对应模型。词级探测分析证实,PIXEL-M4 捕获了丰富的语言特征,即使在预训练期间未见过的语言中也是如此。此外,对其隐藏表示的分析表明,多语言预训练产生了一个在用于预训练的语言之间紧密对齐的语义嵌入空间。这项工作表明,多语言预训练显著增强了像素语言模型有效支持多种语言的能力。

关键词

引用

@article{arxiv.2505.21265,
  title  = {Multilingual Pretraining for Pixel Language Models},
  author = {Ilker Kesen and Jonas F. Lotz and Ingo Ziegler and Phillip Rust and Desmond Elliott},
  journal= {arXiv preprint arXiv:2505.21265},
  year   = {2025}
}

备注

EMNLP 2025