中文

Maya:一种指令微调的多语言多模态模型

计算机视觉与模式识别 2024-12-11 v1 计算与语言

摘要

大型视觉语言模型(VLM)的快速发展已在学术基准测试中取得了令人瞩目的结果,主要集中在广泛使用的语言上。然而,当前VLM在处理低资源语言和多元文化语境方面仍存在显著差距,这主要归因于缺乏高质量、多样化且经过安全性审查的数据。因此,这些模型往往难以以无毒性偏见的方式理解低资源语言和文化细微差别。为解决这些局限性,我们推出了Maya,一个开源的多语言多模态模型。我们的贡献有三:1)基于LLaVA预训练数据集构建了涵盖八种语言的多语言图像-文本预训练数据集;2)对LLaVA数据集中的毒性进行了全面分析,随后创建了涵盖八种语言的无毒性新版本;3)开发了一种支持这些语言的多语言图像-文本模型,增强了视觉语言任务中的文化和语言理解。代码可在 https://github.com/nahidalam/maya 获取。

关键词

引用

@article{arxiv.2412.07112,
  title  = {Maya: An Instruction Finetuned Multilingual Multimodal Model},
  author = {Nahid Alam and Karthik Reddy Kanjula and Surya Guthikonda and Timothy Chung and Bala Krishna S Vegesna and Abhipsha Das and Anthony Susevski and Ryan Sze-Yin Chan and S M Iftekhar Uddin and Shayekh Bin Islam and Roshan Santhosh and Snegha A and Drishti Sharma and Chen Liu and Isha Chaturvedi and Genta Indra Winata and Ashvanth. S and Snehanshu Mukherjee and Alham Fikri Aji},
  journal= {arXiv preprint arXiv:2412.07112},
  year   = {2024}
}