解耦与跟踪:视频扩散 Transformer 的基准测试与改进
计算机视觉与模式识别
2025-08-06 v2
摘要
运动传递任务旨在将源视频的运动传递到新生成的视频中,需要模型将运动从外观中解耦。以往的扩散方法主要依赖于 3D U-Net 中的独立空间和时间注意力机制。相比之下,最新的视频扩散 Transformer (DiT) 模型使用 3D 完全注意力,无法显式分离时间和空间信息。因此,空间和时间维度之间的相互作用使得 DiT 模型在解耦运动和外观方面更具挑战性。本文提出了 DeT 方法,通过引入简单的有效时间核来平滑 DiT 沿时间维度的特征,促进了从背景外观中解耦前景运动。同时,时间核有效捕获 DiT 特征的时间变化,这些变化与运动密切相关。此外,我们引入了在潜在特征空间中沿稠密轨迹上的显式监督,以进一步增强运动一致性。我们还引入了 MTBench,用于运动传递的通用且具挑战性的基准测试。我们还引入了一种混合运动保真度指标,考虑全局和局部运动相似性。因此,我们的工作提供了比以往工作更全面的评估。大量实验表明,在 MTBench 上,DeT 在运动保真度和编辑保真度之间实现了最佳的权衡。
关键词
引用
@article{arxiv.2503.17350,
title = {Decouple and Track: Benchmarking and Improving Video Diffusion Transformers for Motion Transfer},
author = {Qingyu Shi and Jianzong Wu and Jinbin Bai and Jiangning Zhang and Lu Qi and Yunhai Tong and Xiangtai Li},
journal= {arXiv preprint arXiv:2503.17350},
year = {2025}
}
备注
ICCV 2025