FlowInOne:将多模态生成统一为图像入、图像出流匹配
计算机视觉与模式识别
2026-05-15 v2
摘要
多模态生成长期由文本驱动的流水线主导,其中语言主导视觉但无法在其中进行推理或创造。我们挑战这一范式,探讨是否所有模态,包括文本描述、空间布局和编辑指令,都能统一为单一的视觉表示。我们提出了FlowInOne,一个将多模态生成重新表述为纯视觉流的框架,将所有输入转换为视觉提示,并通过单一的流匹配模型实现简洁的图像入、图像出流水线。这种以视觉为中心的表述自然地消除了跨模态对齐瓶颈、噪声调度和任务特定的架构分支,将文本到图像生成、布局引导编辑和视觉指令跟随统一在一个连贯的范式下。为此,我们引入了VisPrompt-5M,一个包含500万视觉提示对的大规模数据集,涵盖从物理感知力动力学到轨迹预测等多种任务,以及VP-Bench,一个严格策划的基准,用于评估指令忠实度、空间精度、视觉真实性和内容一致性。大量实验表明,FlowInOne在所有统一生成任务上取得了最先进的性能,超越了开源模型和竞争性商业系统,为感知与创造共存于单一连续视觉空间的全视觉中心生成建模建立了新的基础。我们的代码和模型发布在 https://csu-jpg.github.io/FlowInOne.github.io/
引用
@article{arxiv.2604.06757,
title = {FlowInOne:Unifying Multimodal Generation as Image-in, Image-out Flow Matching},
author = {Junchao Yi and Rui Zhao and Jiahao Tang and Weixian Lei and Linjie Li and Qisheng Su and Zhengyuan Yang and Lijuan Wang and Xiaofeng Zhu and Alex Jinpeng Wang},
journal= {arXiv preprint arXiv:2604.06757},
year = {2026}
}