中文

VITA:面向开源交互式全模态大语言模型

计算机视觉与模式识别 2025-06-02 v3 人工智能 计算与语言

摘要

GPT-4o卓越的多模态能力和交互体验凸显了它们在实际应用中的必要性,但开源模型很少在这两方面都表现出色。在本文中,我们介绍了VITA,这是首个开源的多模态大语言模型(MLLM),擅长同时处理和分析视频、图像、文本和音频模态,同时具备先进的多模态交互体验。以Mixtral 8x7B作为语言基础,我们扩展了其中文词汇表,随后进行了双语指令微调。我们通过两阶段的多任务学习——多模态对齐和指令微调——进一步赋予语言模型视觉和音频能力。VITA展示了稳健的多语言、视觉和音频理解基础能力,这体现在其在多种单模态和多模态基准测试中的强劲表现。除了基础能力外,我们在增强自然的多模态人机交互体验方面取得了显著进展。VITA是开源社区探索多模态理解与交互无缝整合的第一步。虽然VITA要接近闭源模型仍有许多工作要做,但我们希望其作为先驱的作用可以为后续研究奠定基石。

关键词

引用

@article{arxiv.2408.05211,
  title  = {VITA: Towards Open-Source Interactive Omni Multimodal LLM},
  author = {Chaoyou Fu and Haojia Lin and Zuwei Long and Yunhang Shen and Yuhang Dai and Meng Zhao and Yi-Fan Zhang and Shaoqi Dong and Yangze Li and Xiong Wang and Haoyu Cao and Di Yin and Long Ma and Xiawu Zheng and Rongrong Ji and Yunsheng Wu and Ran He and Caifeng Shan and Xing Sun},
  journal= {arXiv preprint arXiv:2408.05211},
  year   = {2025}
}

备注

Project Page: https://vita-home.github.io