UniModel:面向统一多模态理解与生成的视觉-only框架
计算机视觉与模式识别
2025-11-24 v1
摘要
我们提出UniModel,一个统一的生成模型,同时支持视觉理解与视觉生成,构建于单一的像素到像素扩散框架中。其目标是在模型、任务与表征三个维度实现统一。首先,在表征层面,通过将文本与图像映射到共享视觉空间,消除模态差异:文本提示被渲染为干净画布上的绘画文本图像,所有输入与输出仅以RGB像素形式呈现。这实现了多模态学习的完全视觉原生化。在任务层面,广泛的视觉语言问题被建模为该视觉空间中的像素到像素转换。对于理解任务,模型接收RGB图像并生成编码语义预测的绘画文本图像;对于生成任务,绘画文本图像作为视觉条件引导真实且语义一致的图像合成。因此,描述与文本到图像生成成为同一底层视觉翻译过程的不同方向。在模型层面,我们构建单个在像素空间中使用rectified flow训练的统一扩散变换器。共享主干网络联合学习自然图像与绘画文本图像之间的双向映射,配合轻量级任务嵌入指定所需的转换方向。在文本到图像合成与图像到文本理解实验中,我们展示了强大的跨模态对齐效应以及周期一致的图像-描述-图像循环等新兴可控性。我们的初始探索表明,在单一视觉空间中统一模型、任务与表征是一个通用多模态智能的有前景的范式。
引用
@article{arxiv.2511.16917,
title = {UniModel: A Visual-Only Framework for Unified Multimodal Understanding and Generation},
author = {Chi Zhang and Jiepeng Wang and Youming Wang and Yuanzhi Liang and Xiaoyan Yang and Zuoxin Li and Haibin Huang and Xuelong Li},
journal= {arXiv preprint arXiv:2511.16917},
year = {2025}
}