中文

VINO:交错 OmniModal 上下文统一视觉生成器

计算机视觉与模式识别 2026-01-19 v2

摘要

我们提出 VINO,一个在单个框架内完成图像和视频生成与编辑的统一视觉生成器。不同于依赖针对每个任务或独立模块的模型,VINO 使用共享的扩散主干网络,条件于文本、图像和视频,支持在一个模型下实现广泛的视觉创建和编辑任务。具体而言,VINO 将视觉语言模型 (VLM) 与多模态扩散变换器 (MMDiT) 耦合, multimodal 输入被编码为交错的条件标记,然后用于引导扩散过程。该设计支持多参考 grounding、长形式指令跟随,以及在静态和动态内容之间保持一致的身份保留,同时避免模态特定的架构组件。为训练此类统一系统,我们引入一个多阶段训练管道,逐步扩展视频生成基础模型为能够处理图像和视频输入输出的统一、多任务生成器。 在多样化的生成和编辑基准上,VINO 在视觉质量、指令遵循、参考和属性保留以及更可控的多身份编辑方面均表现出色。我们的结果凸显了可扩展的统一视觉生成的实际路径,以及交错、基于情境的计算作为通用视觉创建基础的潜力。

关键词

引用

@article{arxiv.2601.02358,
  title  = {VINO: A Unified Visual Generator with Interleaved OmniModal Context},
  author = {Junyi Chen and Tong He and Zhoujie Fu and Pengfei Wan and Kun Gai and Weicai Ye},
  journal= {arXiv preprint arXiv:2601.02358},
  year   = {2026}
}

备注

Project page: https://sotamak1r.github.io/VINO-web/