中文

原生多模态建模:一项路线图

计算机视觉与模式识别 2026-05-26 v1

摘要

多模态建模代表了从模态无关推理向世界建模的重要一步。虽然早期方法主要依赖后期融合,将编码器和冻结语言 backbone 与输出头拼接在一起,但近期努力正向原生多模态建模(NMM)范式转变,这种范式通过内在集成模态来实现卓越的多模态性能。尽管如此,原生架构的设计空间仍不充分定义。在本文中,我们为社区提供了一个正式化的转变路线图。具体而言,我们正式定义了架构的原生性,区分了中间融合和早期融合与非原生范式。我们进一步通过输入-输出二元性将现有的原生模型组织分为三个类别:(i) 多模态到文本,用于跨模态理解的文本唯一输出;(ii) 多模态到目标,用于场景导向的生成,例如图像、音频和视频生成;(iii) 多模态到多模态,用于对称输入-输出的统一建模。我们提供了一个针对向确定性 NMM 框架过渡的全面且工业级的调查,其中理解和生成在统一的变换器范式中无缝共存。我们系统地解构了从工业视角看的端到端管线,包括架构协调、大规模数据 curated、到全栈训练配方、推理与部署,以及对 truly 原生建模的全面评估。

关键词

引用

@article{arxiv.2605.25343,
  title  = {Toward Native Multimodal Modeling: A Roadmap},
  author = {Siyu An and Junru Lu and Junnan Dong and Qiufeng Wang and Yinghui Li and Weizhi Fei and Zichao Yu and Zheng Yuan and Biao Liu and Haopeng Wang and Renzhao Liang and Yixuan Yang and Yunhang Shen and Bo Ke and Keyu Chen and Linhao Luo and Difan Zou and Xiao Huang and Di Yin and Ruizhi Qiao and Xing Sun},
  journal= {arXiv preprint arXiv:2605.25343},
  year   = {2026}
}

备注

52 pages, 5 figures, 3 tables, ~300 references