中文

Ming-Omni:统一的感知与生成多模态模型

人工智能 2025-06-12 v1 计算与语言 计算机视觉与模式识别 机器学习 声音 音频与语音处理

摘要

我们提出 Ming-Omni,一个能够处理图像、文本、音频和视频的统一多模态模型,同时在语音和图像生成方面表现出强大能力。Ming-Omni 采用专用编码器从不同模态提取标记,然后由 Ling 进行处理——这是一个配备了新提出的模态特定路由器的 MoE 架构。该设计使单一模型能够在统一框架内高效处理和融合多模态输入,从而促进多样化任务,而无需单独的模型、任务特定微调或结构重设计。重要的是,Ming-Omni 超越了传统多模态模型,支持音频和图像生成。这是通过集成先进的音频解码器以实现自然语音,以及 Ming-Lite-Uni 以实现高质量图像生成来完成的,这也使模型能够进行上下文感知聊天、执行文本转语音转换以及进行多用途图像编辑。我们的实验结果展示了 Ming-Omni 为所有模态提供统一的感知与生成强大解决方案的能力。值得注意的是,我们提出的 Ming-Omni 是我们已知的第一个在模态支持方面匹配 GPT-4o 的开源模型,我们发布所有代码和模型权重以鼓励社区进一步的研究与开发。

关键词

引用

@article{arxiv.2506.09344,
  title  = {Ming-Omni: A Unified Multimodal Model for Perception and Generation},
  author = {Inclusion AI and Biao Gong and Cheng Zou and Chuanyang Zheng and Chunluan Zhou and Canxiang Yan and Chunxiang Jin and Chunjie Shen and Dandan Zheng and Fudong Wang and Furong Xu and GuangMing Yao and Jun Zhou and Jingdong Chen and Jianxin Sun and Jiajia Liu and Jianjiang Zhu and Jun Peng and Kaixiang Ji and Kaiyou Song and Kaimeng Ren and Libin Wang and Lixiang Ru and Lele Xie and Longhua Tan and Lyuxin Xue and Lan Wang and Mochen Bai and Ning Gao and Pei Chen and Qingpei Guo and Qinglong Zhang and Qiang Xu and Rui Liu and Ruijie Xiong and Sirui Gao and Tinghao Liu and Taisong Li and Weilong Chai and Xinyu Xiao and Xiaomei Wang and Xiaoxue Chen and Xiao Lu and Xiaoyu Li and Xingning Dong and Xuzheng Yu and Yi Yuan and Yuting Gao and Yunxiao Sun and Yipeng Chen and Yifei Wu and Yongjie Lyu and Ziping Ma and Zipeng Feng and Zhijiang Fang and Zhihao Qiu and Ziyuan Huang and Zhengyu He},
  journal= {arXiv preprint arXiv:2506.09344},
  year   = {2025}
}

备注

18 pages,8 figures