中文

Aria: 一个开放的多模态原生混合专家模型

计算机视觉与模式识别 2025-01-13 v4

摘要

信息以多种模态呈现。多模态原生AI模型对于整合现实世界信息和提供全面理解至关重要。虽然存在专有的多模态原生模型,但它们缺乏开放性,给采用带来了障碍,更不用说适配了。为了填补这一空白,我们引入了Aria,一个开放的多模态原生模型,在广泛的多模态、语言和编码任务中具有一流性能。Aria是一个混合专家模型,每个视觉标记和文本标记分别有3.9B和3.5B个激活参数。它在各种多模态任务上优于Pixtral-12B和Llama3.2-11B,并与最佳专有模型具有竞争力。我们按照4阶段流程从头开始预训练Aria,逐步赋予模型在语言理解、多模态理解、长上下文窗口和指令遵循方面的强大能力。我们开源了模型权重以及一个代码库,以促进Aria在实际应用中的轻松采用和适配。

关键词

引用

@article{arxiv.2410.05993,
  title  = {Aria: An Open Multimodal Native Mixture-of-Experts Model},
  author = {Dongxu Li and Yudong Liu and Haoning Wu and Yue Wang and Zhiqi Shen and Bowen Qu and Xinyao Niu and Fan Zhou and Chengen Huang and Yanpeng Li and Chongyan Zhu and Xiaoyi Ren and Chao Li and Yifan Ye and Peng Liu and Lihuan Zhang and Hanshu Yan and Guoyin Wang and Bei Chen and Junnan Li},
  journal= {arXiv preprint arXiv:2410.05993},
  year   = {2025}
}