玛雅:构建多语言视觉语言模型
计算机视觉与模式识别
2025-05-16 v2 计算与语言
摘要
近期,我们看到大型视觉语言模型(VLM)的快速发展。它们在学术基准测试中显示出惊人的性能,主要在广为人知的语言中,但在低资源语言和多样化文化语境方面表现不足。为此,我们引入Maya,这是一个开源的多语言VLM。我们的贡献包括:1)基于LLaVA预训练数据集,在八种语言中构建的多语言图像-文本预训练数据集;以及2)支持这些语言的多语言图像-文本模型,增强了在视觉语言任务中的文化和语言理解。代码可在https://github.com/nahidalam/maya获取。
引用
@article{arxiv.2505.08910,
title = {Behind Maya: Building a Multilingual Vision Language Model},
author = {Nahid Alam and Karthik Reddy Kanjula and Surya Guthikonda and Timothy Chung and Bala Krishna S Vegesna and Abhipsha Das and Anthony Susevski and Ryan Sze-Yin Chan and S M Iftekhar Uddin and Shayekh Bin Islam and Roshan Santhosh and Snegha A and Drishti Sharma and Chen Liu and Isha Chaturvedi and Genta Indra Winata and Ashvanth. S and Snehanshu Mukherjee and Alham Fikri Aji},
journal= {arXiv preprint arXiv:2505.08910},
year = {2025}
}
备注
Accepted at VLMs4ALL CVPR 2025 Workshop; corrected workshop name spelling