InteractiveOmni: 用于音视频多轮对话的统一全模态模型
计算机视觉与模式识别
2025-12-04 v2
摘要
我们引入了 InteractiveOmni,一个统一且开源的全模态大型语言模型,用于音视频多轮交互,参数量从 4B 到 8B 不等,旨在通过提供全面的全模态理解和语音生成能力来引领轻量级模型领域。为此,我们将视觉编码器、音频编码器、大型语言模型和语音解码器集成到一个统一的模型中,用于理解和生成任务。我们设计了一种多阶段训练策略以确保强大的跨模态能力,包括用于全模态理解的预训练,以及随后使用语音对话和音视频交互进行后训练。为了实现类似人类的长期对话能力,我们精心整理了一个多轮训练数据集,增强了模型处理复杂和多轮交互的能力。为了有效评估多轮记忆和语音交互能力,我们构建了多模态多轮记忆基准和多轮语音交互基准。实验表明,InteractiveOmni 显著优于领先的开源模型,并提供了更智能的多轮音视频体验,尤其是在其长期记忆能力方面。值得注意的是,InteractiveOmni-4B 在通用基准上与更大的模型(如 Qwen2.5-Omni-7B)相当,并且在使用仅 50% 模型大小的情况下,可以保留 InteractiveOmni-8B 97% 的性能。在图像、音频、视频理解和语音生成任务上,InteractiveOmni 在与类似规模模型的对比中取得了最先进的结果,为下一代智能交互系统提供了一个可访问的、开源的基础。
引用
@article{arxiv.2510.13747,
title = {InteractiveOmni: A Unified Omni-modal Model for Audio-Visual Multi-turn Dialogue},
author = {Wenwen Tong and Hewei Guo and Dongchuan Ran and Jiangnan Chen and Jiefan Lu and Kaibin Wang and Keqiang Li and Xiaoxu Zhu and Jiakui Li and Kehan Li and Xueheng Li and Lumin Li and Chenxu Guo and Jiasheng Zhou and Jiandong Chen and Xianye Wu and Jiahao Wang and Silei Wu and Lei Chen and Hanming Deng and Yuxuan Song and Dinghao Zhou and Guiping Zhong and Ken Zheng and Shiyin Kang and Lewei Lu},
journal= {arXiv preprint arXiv:2510.13747},
year = {2025}
}