DiViD:用于静态-动态因子分解的解耦视频扩散
计算机视觉与模式识别
2025-10-07 v2
摘要
视频中静态外观与动态运动的无监督解耦仍是一项基本挑战,现有基于 VAE 和 GAN 的方法常受信息泄漏和模糊重建的阻碍。我们引入了 DiViD,这是首个用于显式静态-动态因子分解的端到端视频扩散框架。DiViD 的序列编码器从第一帧提取全局静态 token 和逐帧动态 token,显式地从运动编码中移除静态内容。其条件 DDPM 解码器引入了三个关键归纳偏置:用于时间一致性的共享噪声调度;在早期时间步收紧(压缩静态信息)并在后期放松(丰富动态)的时变基于 KL 的瓶颈;以及将全局静态 token 路由至所有帧、同时保持动态 token 逐帧特异性的交叉注意力。正交性正则化器进一步防止了残余的静态-动态泄漏。我们在真实世界基准上使用基于交换的准确率和交叉泄漏指标对 DiViD 进行了评估。DiViD 优于当前最先进的序列解耦方法:它实现了最高的基于交换的联合准确率,在提高动态迁移的同时保持了静态保真度,并减少了平均交叉泄漏。
引用
@article{arxiv.2507.13934,
title = {DiViD: Disentangled Video Diffusion for Static-Dynamic Factorization},
author = {Marzieh Gheisari and Auguste Genovesio},
journal= {arXiv preprint arXiv:2507.13934},
year = {2025}
}