中文

Tora:基于轨迹的扩散Transformer用于视频生成

计算机视觉与模式识别 2025-03-17 v4

摘要

近期扩散Transformer (DiT) 的发展表明,其在生成高质量视频内容方面具有显著优势。然而,基于Transformer的扩散模型在有效生成带可控运动的视频方面的潜力仍受到有限探索。本文介绍Tora,即首个集成文本、视觉与轨迹条件的轨迹导向DiT框架,从而实现可扩展且具有效动作引导的视频生成。具体而言,Tora由轨迹提取器(TE)、空间时间DiT和运动引导融合器(MGF)组成。TE通过3D运动压缩网络将任意轨迹编码为层次化时空运动补丁。MGF将运动补丁整合到DiT模块中,以生成准确遵循指定轨迹的连贯视频。我们的设计无缝与DiT的可扩展性相吻合,可实现对视频内容动态特性的精确控制,包括多样化的时长、宽高比和分辨率。广泛的实验表明,Tora在实现高运动保真度方面优于基础DiT模型,同时也能准确模拟物理世界中复杂运动。代码已发布于https://github.com/alibaba/Tora。

关键词

引用

@article{arxiv.2407.21705,
  title  = {Tora: Trajectory-oriented Diffusion Transformer for Video Generation},
  author = {Zhenghao Zhang and Junchao Liao and Menghao Li and Zuozhuo Dai and Bingxue Qiu and Siyu Zhu and Long Qin and Weizhi Wang},
  journal= {arXiv preprint arXiv:2407.21705},
  year   = {2025}
}

备注

CVPR 2025 Conference Proceedings