中文

Tora2:面向多实体视频生成的运动与外观定制扩散变换器

计算机视觉与模式识别 2025-07-10 v2

摘要

近期发展的扩散变换器模型用于运动引导视频生成,如 Tora,已取得显著进展。本文提出 Tora2,是 Tora 的增强版,引入若干设计改进以扩充其在外观和运动定制方面的能力。具体而言,我们引入解耦的 personalization 提取器,用于生成多个 open-set 实体的全面 personalization 嵌入,较先前方法更好地保留细粒度视觉细节。基于此,我们设计一种门控自注意力机制,用于整合每个实体的轨迹、文本描述和视觉信息。这一创新显著减少了训练期间多模态条件的错位。此外,我们引入对比损失,通过显式映射运动与 personalization 嵌入,联合优化轨迹动力学和实体一致性。Tora2 是已知在多实体视频生成中实现外观与运动同步定制的首个方法。实验结果表明,Tora2 在实现竞争性能的同时,提供了先进的运动控制能力,这标志着多条件视频生成的关键性进步。项目页面:https://ali-videoai.github.io/Tora2_page/。

关键词

引用

@article{arxiv.2507.05963,
  title  = {Tora2: Motion and Appearance Customized Diffusion Transformer for Multi-Entity Video Generation},
  author = {Zhenghao Zhang and Junchao Liao and Xiangyu Meng and Long Qin and Weizhi Wang},
  journal= {arXiv preprint arXiv:2507.05963},
  year   = {2025}
}

备注

ACM MM25 Conference Proceedings