Wan-Weaver:通过解耦训练实现交错多模态生成
计算机视觉与模式识别
2026-03-31 v2
摘要
最近的统一模型在理解和生成方面取得了 unprecedented 的进展。然而,尽管大多数模型接受多模态输入,但通常只产生单一模态输出。这种产生交错内容的挑战主要源于训练数据的稀缺以及建模长程跨模态上下文的困难。为此,我们将交错生成分解为文本规划和视觉一致性建模,提出由 planner 和 visualizer 组成的框架。planner 生成用于视觉内容的稠密文本描述,而 visualizer 根据此进行图像合成。在此指导下,我们构建了大规模文本-代理交错数据(其中视觉内容以文本表示),用于训练 planner,并精选参考引导的图像数据用于训练 visualizer。这些设计使得 Wan-Weaver 能够以长期文本连贯性和视觉一致性展现出涌现的交错生成能力。此外,融合多样化理解和生成数据到 planner 训练中,使 Wan-Weaver 能够实现稳健的任务推理和生成熟练。为评估模型在交错生成方面的能力,我们进一步构建了一个横跨多个维度用例的基准。大量实验表明,即使不接触任何真实的交错数据,Wan-Weaver 仍优于现有方法。
引用
@article{arxiv.2603.25706,
title = {Wan-Weaver: Interleaved Multi-modal Generation via Decoupled Training},
author = {Jinbo Xing and Zeyinzi Jiang and Yuxiang Tuo and Chaojie Mao and Xiaotang Gai and Xi Chen and Jingfeng Zhang and Yulin Pan and Zhen Han and Jie Xiao and Keyu Yan and Chenwei Xie and Chongyang Zhong and Kai Zhu and Tong Shen and Lianghua Huang and Yu Liu and Yujiu Yang},
journal= {arXiv preprint arXiv:2603.25706},
year = {2026}
}
备注
CVPR 2026 Camera-ready, Webpage: https://doubiiu.github.io/projects/WanWeaver