结构来自跟踪:将结构保持运动蒸馏用于视频生成
计算机视觉与模式识别
2025-12-15 v1
摘要
现实在刚性约束与可变形结构之间起舞。对于视频模型而言,这意味着生成既保持保真度又保持结构的运动。尽管扩散模型取得了进展,生成真实的结构保持运动仍然具有挑战性,尤其是对于关节可动和可变形物体,如人类和动物。仅靠扩大训练数据迄今为止未能解决物理上不合理的过渡。现有方法依赖于含噪声的运动表示作为条件,例如光流或使用外部不完美模型提取的骨架。为应对这些挑战,我们提出了一种算法,将自回归视频跟踪模型(SAM2)中的结构保持运动先验蒸馏到双向视频扩散模型(CogVideoX)中。使用我们的方法,我们训练了 SAM2VideoX,其中包含两项创新:(1) 一个双向特征融合模块,从循环模型如 SAM2 中提取全局结构保持运动先验;(2) 一个局部 Gram Flow 损失,用于对齐局部特征的协同运动方式。在 VBench 上的实验和人工研究表明,SAM2VideoX 相比先前基线实现了持续提升(VBench 上 +2.60%,FVD 降低 21-22%,人类偏好 71.4%)。具体而言,在 VBench 上我们达到了 95.51%,超越 REPA(92.91%)2.60%,并将 FVD 降至 360.57,相比 REPA 和 LoRA 微调分别提升 21.20% 和 22.46%。项目网站位于 https://sam2videox.github.io/ 。
引用
@article{arxiv.2512.11792,
title = {Structure From Tracking: Distilling Structure-Preserving Motion for Video Generation},
author = {Yang Fei and George Stoica and Jingyuan Liu and Qifeng Chen and Ranjay Krishna and Xiaojuan Wang and Benlin Liu},
journal= {arXiv preprint arXiv:2512.11792},
year = {2025}
}
备注
Project Website: https://sam2videox.github.io/