中文

Aya Vision:多语言多模态的前沿突破

计算与语言 2025-05-14 v1 计算机视觉与模式识别 机器学习

摘要

构建多模态语言模型本质上具有挑战性:需要对齐视觉和语言模态、精选高质量指令数据,同时避免在引入视觉能力后使现有文本-only 能力退化。在多语言环境中,这些困难更为严峻,因为不同语言的多模态数据稀缺、机器翻译常扭曲语义、且遗忘效应更为突出。为此,我们引入了横跨数据与模型的新技术。首先,我们开发了合成标注框架,筛选出高质量、多样化的多语言多模态指令数据,使 Aya Vision 模型能够在多种语言下,对多模态输入生成自然、人类偏好的响应。此外,我们提出了一种跨模态模型合并技术,缓解遗忘效应,有效保留文本-only 能力,同时提升多模态生成性能。Aya-Vision-8B 在与 Qwen-2.5-VL-7B、Pixtral-12B 以及更大规模的 Llama-3.2-90B-Vision 等强大多模态模型相比较时,均实现最佳性能。我们进一步扩展这一方法,推出 Aya-Vision-32B,其性能超过体积是其数倍的模型,如 Molmo-72B 和 LLaMA-3.2-90B-Vision。我们的工作推动了多模态前沿领域的多语言进展,提供了有效降低计算资源需求、实现极高性能的技术洞见。

关键词

引用

@article{arxiv.2505.08751,
  title  = {Aya Vision: Advancing the Frontier of Multilingual Multimodality},
  author = {Saurabh Dash and Yiyang Nan and John Dang and Arash Ahmadian and Shivalika Singh and Madeline Smith and Bharat Venkitesh and Vlad Shmyhlo and Viraat Aryabumi and Walter Beller-Morales and Jeremy Pekmez and Jason Ozuzu and Pierre Richemond and Acyr Locatelli and Nick Frosst and Phil Blunsom and Aidan Gomez and Ivan Zhang and Marzieh Fadaee and Manoj Govindassamy and Sudip Roy and Matthias Gallé and Beyza Ermis and Ahmet Üstün and Sara Hooker},
  journal= {arXiv preprint arXiv:2505.08751},
  year   = {2025}
}