中文

基于比特率控制扩散的视频运动与内容解耦

计算机视觉与模式识别 2025-09-11 v1

摘要

我们提出一种新颖且通用的框架,用于将视频数据解耦为其动态运动和静态内容组成部分。我们的方法是自监督的管道,比以往工作少一些假设和归纳偏置:它利用基于转换器的体系结构联合生成帧级运动和片段级内容的灵活隐式特征,并将低比特率向量量化作为信息瓶颈,以促进解耦并形成有意义的离散运动空间。比特率控制的潜在运动和内容用作条件输入到去噪扩散模型中,以促进自监督的表征学习。我们在真实世界的说话人头视频上验证了我们的解耦表征学习框架,用于运动迁移和自回归运动生成任务。此外,我们还展示了该方法可以推广到其他类型的视频数据,例如2D卡通人物的像素精灵。我们的工作为自监督学习解耦视频表征提供了新的视角,为更广泛的视频分析和生成领域做出了贡献。

关键词

引用

@article{arxiv.2509.08376,
  title  = {Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video},
  author = {Xiao Li and Qi Chen and Xiulian Peng and Kai Yu and Xie Chen and Yan Lu},
  journal= {arXiv preprint arXiv:2509.08376},
  year   = {2025}
}