中文

玛雅:构建多语言视觉语言模型

计算机视觉与模式识别 2025-05-16 v2 计算与语言

摘要

近期,我们看到大型视觉语言模型(VLM)的快速发展。它们在学术基准测试中显示出惊人的性能,主要在广为人知的语言中,但在低资源语言和多样化文化语境方面表现不足。为此,我们引入Maya,这是一个开源的多语言VLM。我们的贡献包括:1)基于LLaVA预训练数据集,在八种语言中构建的多语言图像-文本预训练数据集;以及2)支持这些语言的多语言图像-文本模型,增强了在视觉语言任务中的文化和语言理解。代码可在https://github.com/nahidalam/maya获取。

关键词

引用

@article{arxiv.2505.08910,
  title  = {Behind Maya: Building a Multilingual Vision Language Model},
  author = {Nahid Alam and Karthik Reddy Kanjula and Surya Guthikonda and Timothy Chung and Bala Krishna S Vegesna and Abhipsha Das and Anthony Susevski and Ryan Sze-Yin Chan and S M Iftekhar Uddin and Shayekh Bin Islam and Roshan Santhosh and Snegha A and Drishti Sharma and Chen Liu and Isha Chaturvedi and Genta Indra Winata and Ashvanth. S and Snehanshu Mukherjee and Alham Fikri Aji},
  journal= {arXiv preprint arXiv:2505.08910},
  year   = {2025}
}

备注

Accepted at VLMs4ALL CVPR 2025 Workshop; corrected workshop name spelling