SenseNova-U1:基于NEO-unify架构的多模态理解与生成统一
计算机视觉与模式识别
2026-05-13 v1
摘要
最近的大型视觉语言模型(VLMs)仍然根本受限于一种持续的二元对立:理解和生成被视为两个独立的问题,导致架构碎片化、级联管道以及不对齐的表示空间。我们认为,这种分离不仅仅是一种工程痕迹,而是一种结构性限制,阻碍了原生多模态智能的涌现。因此,我们引入SenseNova-U1,一个建立在NEO-unify之上的原生统一多模态范式,其中理解和生成演化为单一底层过程的协同视角。我们推出了两个原生统一变体:SenseNova-U1-8B-MoT 和 SenseNova-U1-A3B-MoT,分别基于稠密(8B)和混合专家(30B-A3B)理解基线构建。从原理出发设计的模型在文本理解、视觉语言感知、知识推理、智能决策和空间智能方面与顶级仅理解型VLMs相媲美。同时,它们在语义一致性和视觉保真度方面表现优异,在传统或知识密集型的任意到图像(X2I)合成、复杂文本丰富的图表生成以及交错视觉语言生成方面表现突出,无论是否带有思考模式。除了性能之外,我们展示了详细的模型设计、数据预处理、预/后训练以及推理策略,以支持社区研究。最后但不least,初步证据表明,我们的模型不仅限于感知和生成,在视觉语言-动作(VLA)和世界模型(WM)场景中也表现出色。这指向了更广泛的路线图,其中模型不通过模态之间的转换来实现,而是以原生方式在模态之间进行思考和行动。多模态AI不再是连接独立系统,而是构建一个统一的系统并信赖其内部涌现的必要能力。
引用
@article{arxiv.2605.12500,
title = {SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture},
author = {Haiwen Diao and Penghao Wu and Hanming Deng and Jiahao Wang and Shihao Bai and Silei Wu and Weichen Fan and Wenjie Ye and Wenwen Tong and Xiangyu Fan and Yan Li and Yubo Wang and Zhijie Cao and Zhiqian Lin and Zhitao Yang and Zhongang Cai and Yuwei Niu and Yue Zhu and Bo Liu and Chengguang Lv and Haojia Yu and Haozhe Xie and Hongli Wang and Jianan Fan and Jiaqi Li and Jiefan Lu and Jingcheng Ni and Junxiang Xu and Kaihuan Liang and Lianqiang Shi and Linjun Dai and Linyan Wang and Oscar Qian and Peng Gao and Pengfei Liu and Qingping Sun and Rui Shen and Ruisi Wang and Shengnan Ma and Shuang Yang and Siyi Xie and Siying Li and Tianbo Zhong and Xiangli Kong and Xuanke Shi and Yang Gao and Yongqiang Yao and Yves Wang and Zhengqi Bai and Zhengyu Lin and Zixin Yin and Wenxiu Sun and Ruihao Gong and Quan Wang and Lewei Lu and Lei Yang and Ziwei Liu and Dahua Lin},
journal= {arXiv preprint arXiv:2605.12500},
year = {2026}
}
备注
Project page: https://github.com/OpenSenseNova/SenseNova-U1