中文

Pangea:面向39种语言的全开源多模态大语言模型

计算与语言 2025-01-28 v3 计算机视觉与模式识别

摘要

尽管近期在多模态大语言模型(MLLM)方面取得了进展,但其开发主要聚焦于英语及西方中心的数据集与任务,导致大多数世界语言及多样文化语境被边缘化。本文介绍了Pangea,一款在PangeaIns数据集上训练的多语言多模态大语言模型。PangeaIns数据集包含39种语言、600万条指令数据,特点包括:1)高质量英语指令,2)精心机器翻译的指令,3)具有跨文化覆盖性的多模态任务。为严格评估模型能力,我们引入了PangeaBench——一个涵盖47种语言、14个数据集的综合性评估套件。结果表明,Pangea在多语言和多元文化语境下显著优于现有开源模型。消融研究进一步揭示了英语数据比例、语言流行度以及多模态训练样本数量对整体性能的重要性。我们全程开源数据、代码及训练好的模型checkpoint,以促进包容性和鲁棒性更强的多语言MLLM的发展,推动跨更广阔语言与文化 Spectrum 的公平性与可及性。

关键词

引用

@article{arxiv.2410.16153,
  title  = {Pangea: A Fully Open Multilingual Multimodal LLM for 39 Languages},
  author = {Xiang Yue and Yueqi Song and Akari Asai and Seungone Kim and Jean de Dieu Nyandwi and Simran Khanuja and Anjali Kantharuban and Lintang Sutawika and Sathyanarayanan Ramamoorthy and Graham Neubig},
  journal= {arXiv preprint arXiv:2410.16153},
  year   = {2025}
}

备注

54 pages, 27 figures