中文

VITA-1.5:面向GPT-4o水平的实时视觉与语音交互

计算机视觉与模式识别 2025-10-27 v4 声音 音频与语音处理

摘要

最近的多模态大语言模型(MLLM)通常侧重于整合视觉和文本模态,对语音在交互中所发挥的作用关注不足。然而,语音在多模态对话系统中起着关键作用,实现视觉和语音任务的高性能仍是一个显著挑战,因为模态之间的根本差异。本文提出了一种精心设计的多阶段训练方法,逐步训练LLM以理解视觉和语音信息,从而实现流畅的视觉和语音交互。我们的方法不仅保留了强大的视觉语言能力,还实现了无需独立语音识别(ASR)和语音合成(TTS)模块的高效语音到语音对话能力,显著加快了多模态端到端响应速度。通过在图像、视频和语音任务基准测试中与最先进的方法进行比较,我们展示了该模型具备强大的视觉和语音能力,实现了接近实时的视觉和语音交互。代码已发布于https://github.com/VITA-MLLM/VITA。

关键词

引用

@article{arxiv.2501.01957,
  title  = {VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction},
  author = {Chaoyou Fu and Haojia Lin and Xiong Wang and Yi-Fan Zhang and Yunhang Shen and Xiaoyu Liu and Haoyu Cao and Zuwei Long and Heting Gao and Ke Li and Long Ma and Xiawu Zheng and Rongrong Ji and Xing Sun and Caifeng Shan and Ran He},
  journal= {arXiv preprint arXiv:2501.01957},
  year   = {2025}
}

备注

NeurIPS 2025 Spotlight, Code 2.4K Stars: https://github.com/VITA-MLLM/VITA