Emu3.5:原生多模态模型是世界学习者
计算机视觉与模式识别
2025-10-31 v1
摘要
我们介绍 Emu3.5,这是一个大规模多模态世界模型,能够原生地在视觉和语言之间预测下一个状态。Emu3.5 采用统一的下一个 token 预测目标,对包含超过万亿个 token 的视觉语言交错数据语料库进行端到端预训练,主要来自互联网视频的顺序帧和转录本。该模型能够自然地接受交错的视觉语言输入,并生成交错的视觉语言输出。在大规模强化学习后训练中进一步提升其多模态推理与生成能力。为提高推理效率,我们提出离散扩散适应(DiDA),将基于 token 的解码转换为双向并行预测,约以 20 倍加速单图像推理,同时不损失性能。Emu3.5 展现出强大的原生多模态能力,包括长程视觉语言生成、任意到图像(X2I)生成以及复杂文本丰富图像生成。它还展现出可泛化的世界建模能力,使其能够在多样化情景和任务中实现空间时间一致的世界探索和开放式本体操控。与 Gemini 2.5 Flash Image(Nano Banana)在图像生成与编辑任务中达到相当水平,并在一套交错生成任务中展现出优异成绩。我们在https://github.com/baaivision/Emu3.5 上开源 Emu3.5 以支持社区研究。
引用
@article{arxiv.2510.26583,
title = {Emu3.5: Native Multimodal Models are World Learners},
author = {Yufeng Cui and Honghao Chen and Haoge Deng and Xu Huang and Xinghang Li and Jirong Liu and Yang Liu and Zhuoyan Luo and Jinsheng Wang and Wenxuan Wang and Yueze Wang and Chengyuan Wang and Fan Zhang and Yingli Zhao and Ting Pan and Xianduo Li and Zecheng Hao and Wenxuan Ma and Zhuo Chen and Yulong Ao and Tiejun Huang and Zhongyuan Wang and Xinlong Wang},
journal= {arXiv preprint arXiv:2510.26583},
year = {2025}
}
备注
project page: https://emu.world