中文

COMUNI:分解常见与唯一视频信号用于扩散式视频生成

计算机视觉与模式识别 2024-10-03 v1

摘要

由于视频记录了物体的连贯运动,相邻的视频帧具有commonness(相似的物体外观)和uniqueness(略有变化的姿态)。为了防止对common video signals进行冗余建模,我们提出了一种新型扩散式框架,称为COMUNI,通过分解COMmon和UNIque视频信号来实现高效视频生成。我们的做法将视频信号的分解与视频生成任务分离,从而降低了生成模型的计算复杂度。具体而言,我们引入CU-VAE来分解视频信号并将其编码为潜在特征。在以自监督方式训练CU-VAE方面,我们采用级联合并模块来重构视频信号,并使用时间无关的视频解码器来重建视频帧。随后,我们提出CU-LDM来建模视频生成的潜在特征,采用两个特定的扩散流同时建模common和unique潜在特征。我们进一步利用额外的joint模块进行common和unique潜在特征的交叉建模,并提出一种新颖的位置嵌入方法,以确保生成视频的内容一致性和运动连贯性。该位置嵌入方法将空间和时间绝对位置信息纳入joint模块中。广泛的实验结果表明,分解common和unique视频信号对于视频生成是必要的,并且我们提出的方法在有效性和效率方面都得到了验证。

关键词

引用

@article{arxiv.2410.01718,
  title  = {COMUNI: Decomposing Common and Unique Video Signals for Diffusion-based Video Generation},
  author = {Mingzhen Sun and Weining Wang and Xinxin Zhu and Jing Liu},
  journal= {arXiv preprint arXiv:2410.01718},
  year   = {2024}
}