Ming-Flash-Omni:面向多模态感知与生成的稀疏统一架构
计算机视觉与模式识别
2026-03-27 v3 人工智能
摘要
我们提出 Ming-Flash-Omni,这是 Ming-Omni 的升级版,基于 Ling-Flash-2.0 的稀疏 Mixture-of-Experts(MoE)变体构建,总参数数为 1000 亿,其中每个 token 仅激活 61 亿参数。该架构实现了高度的规模化效率(显著提升计算效率的同时大幅扩大模型容量),并赋予了更强的统一多模态智能,涵盖视觉、语音与语言,标志着向人工通用智能(AGI)的关键一步。与其前身相比,升级版在多模态理解与生成方面实现了显著提升。值得注意的是,在视觉语言理解基准测试中取得优异成绩,整体得分与 Gemini 2.5 Pro 挥平,并实现了在多轮交互中无缝切换多模态任务。在语音方面,实现了在情境感知和方言识别方面的强大表现,并支持语音、声音与音乐的联合、连续生成。在视觉方面,引入了实现竞争力的独立性能力的生成语义分割,并显著提升了空间控制和编辑一致性,同时在身份保留和图像内文本渲染的高保真度方面实现了显著提升。这些能力共同表明,单个统一模型可作为通用多模态智能的实用基础。
引用
@article{arxiv.2510.24821,
title = {Ming-Flash-Omni: A Sparse, Unified Architecture for Multimodal Perception and Generation},
author = {Inclusion AI and : and Bowen Ma and Cheng Zou and ChengKun Du and Canxiang Yan and Chunxiang Jin and Chunjie Shen and Chenyu Lian and Chengxiang Fan and Dandan Zheng and Fudong Wang and Furong Xu and Guangming Yao and Haohao Liu and Han Peng and Jun Zhou and Junluan Xia and Jingdong Chen and Jianing Li and Jianxin Sun and Jianjiang Zhu and Jianping Jiang and Jinpeng Ou and Jun Peng and Jin Peng and Kaixiang Ji and Li Tang and Libin Wang and Lixiang Ru and Longhua Tan and Lu Ma and Lan Wang and Mochen Bai and Minghong Cai and Mingxue Yang and Ning Gao and Qingpei Guo and Qinglong Zhang and Qiang Xu and Qin Zhao and Rui Liu and Ruijie Xiong and Ruobing Zheng and Sirui Gao and Shaoxiong Lin and Tao Zhang and Tianqi Li and Tinghao Liu and Tongli Wang and Taoye Huang and Weilong Chai and Xiaomei Wang and Xiaolong Wang and Xiaojian Liu and Xiao Lu and Xiaoyu Li and Xingning Dong and Xuzheng Yu and Xuezhi Wang and Yi Yuan and Yuting Gao and Yuting Xiao and Yunxiao Sun and Yipeng Chen and Yifan Mao and Yifei Wu and Yongjie Lyu and Yingying Zhang and YuQian Li and Ziping Ma and Zhiqiang Fang and Zhihao Qiu and Ziyuan Huang and Zizheng Yang and Zhengyu He},
journal= {arXiv preprint arXiv:2510.24821},
year = {2026}
}
备注
18 pages, 5 figures