大型多语言模型跨语言枢纽零样本多模态学习
计算与语言
2024-03-25 v3 计算机视觉与模式识别
摘要
近来,无论是图像到文本还是文本到图像生成,多模态学习都出现了显著激增。然而,这一成功通常局限于英语,其他语言在很大程度上被落下。由于非英语多模态数据的低资源特性(即缺乏大规模、高质量的图像-文本数据),构建其他语言中具竞争力的对应模型极具挑战。在这项工作中,我们提出 MPM,一种用于在非英语语言中训练大型多模态模型的有效训练范式。MPM 表明多语言语言模型可以跨语言枢纽零样本多模态学习。具体而言,基于强大的多语言大语言模型,仅在英语图像-文本数据上预训练的多模态模型可以(准)零样本方式很好地泛化到其他语言,甚至超越在本土语言图像-文本数据上训练的模型。以中文作为 MPM 的实例,我们构建了图像到文本和文本到图像生成的大型多模态模型 VisCPM,其在中文上取得了最先进的(开源)性能。为促进未来研究,我们在 https://github.com/OpenBMB/VisCPM.git 开源代码和模型权重。
引用
@article{arxiv.2308.12038,
title = {Large Multilingual Models Pivot Zero-Shot Multimodal Learning across Languages},
author = {Jinyi Hu and Yuan Yao and Chongyi Wang and Shan Wang and Yinxu Pan and Qianyu Chen and Tianyu Yu and Hanghao Wu and Yue Zhao and Haoye Zhang and Xu Han and Yankai Lin and Jiao Xue and Dahai Li and Zhiyuan Liu and Maosong Sun},
journal= {arXiv preprint arXiv:2308.12038},
year = {2024}
}
备注
https://github.com/OpenBMB/VisCPM.git