BindWeave:基于跨模态集成的主体一致视频生成
计算机视觉与模式识别
2026-03-04 v2
摘要
扩散Transformer在生成高保真视频方面展现出惊人的能力,能够在持续较长时间内生成视觉连贯的帧和丰富的细节。然而,现有的视频生成模型仍在主体一致性视频生成方面不足,因为难以解析指定复杂空间关系、时序逻辑以及多个主体之间的相互作用的提示。为此,我们提出BindWeave,一个统一的框架,能够处理从单主体情况到具有异构实体的复杂多主体场景的广泛主体到视频场景。为了将复杂提示语义绑定到具体的视觉主体上,我们引入MLLM-DiT框架,其中预训练的多模态大语言模型进行深入的跨模态推理,以对实体进行 grounding 并分离角色、属性和相互作用,生成用于条件化扩散Transformer以进行高保真主体一致视频生成的主体感知隐藏状态。在OpenS2V基准测试上进行实验,表明该方法在主体一致性、自然性和文本相关性方面性能卓越,超越了现有的开源和商业模型。
引用
@article{arxiv.2510.00438,
title = {BindWeave: Subject-Consistent Video Generation via Cross-Modal Integration},
author = {Zhaoyang Li and Dongjun Qian and Kai Su and Qishuai Diao and Xiangyang Xia and Chang Liu and Wenfei Yang and Tianzhu Zhang and Zehuan Yuan},
journal= {arXiv preprint arXiv:2510.00438},
year = {2026}
}
备注
Accepted by ICLR 2026