Mini-Omni2: 面向开源 GPT-4o 的视觉、语音与双工能力
音频与语音处理
2024-11-06 v3 人工智能
计算机视觉与模式识别
机器学习
声音
摘要
GPT-4o 作为一种全能型模型,标志着大型多模态语言模型开发的里程碑。它能够理解视觉、听觉和文本三种模态,能够直接输出音频,并支持灵活的双工交互。开源社区的模型往往能够实现 GPT-4o 的某些功能,如视觉理解和语音聊天。然而,由于多模态数据的复杂性、模型架构的复杂以及训练过程的复杂,训练一个集成所有模态的统一模型具有较大的挑战性。本文介绍了 Mini-Omni2,这是一个具备实时、端到端语音响应能力的视觉-音频助手,能够针对视觉和音频查询提供语音响应。通过集成预训练的视觉和听觉编码器,Mini-Omni2 在各个单一模态上保持了性能。我们提出了三阶段的训练流程,以对齐模态,使语言模型在有限数据集上训练后能够处理多模态输入和输出。对于交互方式,本文引入了基于命令的中断机制,使其能够更灵活地与用户进行交互。鉴于 Mini-Omni2 目前是众多最接近 GPT-4o 功能再现之一,具有相似的功能形式,我们希望它能为后续研究提供有价值的见解。
引用
@article{arxiv.2410.11190,
title = {Mini-Omni2: Towards Open-source GPT-4o with Vision, Speech and Duplex Capabilities},
author = {Zhifei Xie and Changqiao Wu},
journal= {arXiv preprint arXiv:2410.11190},
year = {2024}
}
备注
Technical report, work in progress. Demo and code: https://github.com/gpt-omni/mini-omni2