中文

Stream-Omni:大型语言-视觉-语音模型的同步多模态交互

人工智能 2025-06-24 v2 计算与语言 计算机视觉与模式识别 声音 音频与语音处理

摘要

GPT-4o等大型多模态模型(LMM)的出现, 推动了将文本、视觉和语音模态集成以支持更灵活多模态交互的探索。现有的LMM通常沿序列维度拼接模态表示并输入到大型语言模型(LLM)主干。虽然序列维度的拼接在模态集成方面直观, 但它通常高度依赖大规模数据来学习模态对齐。本文我们旨在更有目的地地建模模态之间的关系, 从而实现更高效和更灵活的模态对齐。为此, 我们提出了Stream-Omni, 一个具有高效模态对齐的大型语言-视觉-语音模型, 可支持各种模态组合的交互。Stream-Omni采用LLM作为主干, 并基于模态间关系将视觉和语音对齐到文本。对于与文本语义互补的视觉, Stream-Omni使用序列维度拼接实现视觉-文本对齐。对于与文本语义一致的语音, Stream-Omni引入基于CTC的层维映射实现语音-文本对齐。如此, Stream-Omni能够以更少数据(尤其是语音数据)实现模态对齐, 将文本能力传输到其他模态。在各种基准测试上进行的实验表明, Stream-Omni在视觉理解、语音交互和视觉 grounding 语音交互任务上均取得优异性能。由于采用层维映射, Stream-Omni能够在语音交互期间同步提供中间文本输出(如ASR转录和模型响应), 为用户提供了全面的多模态体验。

关键词

引用

@article{arxiv.2506.13642,
  title  = {Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model},
  author = {Shaolei Zhang and Shoutao Guo and Qingkai Fang and Yan Zhou and Yang Feng},
  journal= {arXiv preprint arXiv:2506.13642},
  year   = {2025}
}

备注

Code: https://github.com/ictnlp/Stream-Omni , Model: https://huggingface.co/ICTNLP/stream-omni-8b