PALO:面向50亿人的多语言大型多模态模型
计算与语言
2024-03-06 v2 计算机视觉与模式识别
摘要
为了追求更具包容性的视觉-语言模型(VLM),本研究引入了一个大型多语言多模态模型,称为PALO。PALO提供10种主要语言的视觉推理能力,包括英语、中文、印地语、西班牙语、法语、阿拉伯语、孟加拉语、俄语、乌尔都语和日语,覆盖总计约50亿人(占世界人口的65%)。我们的方法涉及一种半自动翻译方法,使用微调的大型语言模型将多模态指令数据集从英语适配到目标语言,从而确保高语言保真度,同时由于最少的人工努力而实现可扩展性。多样化指令集的整合帮助我们在多种语言上提升整体性能,尤其是那些代表性不足的语言,如印地语、阿拉伯语、孟加拉语和乌尔都语。生成的模型在三种规模(1.7B、7B和13B参数)上进行训练,以展示泛化和可扩展性,我们观察到与强基线相比有显著改进。我们还提出了第一个多语言多模态基准,供后续方法评估其跨语言的视觉-语言推理能力。代码:https://github.com/mbzuai-oryx/PALO。
引用
@article{arxiv.2402.14818,
title = {PALO: A Polyglot Large Multimodal Model for 5B People},
author = {Muhammad Maaz and Hanoona Rasheed and Abdelrahman Shaker and Salman Khan and Hisham Cholakal and Rao M. Anwer and Tim Baldwin and Michael Felsberg and Fahad S. Khan},
journal= {arXiv preprint arXiv:2402.14818},
year = {2024}
}
备注
Technical Report of PALO