中文

作为内容-运动解耦归纳偏置的视频重演

计算机视觉与模式识别 2022-02-22 v3 机器学习

摘要

低维表示中的独立分量在若干下游任务中是关键输入,并给出对观测数据的解释。基于视频的解耦变异因子提供可被识别并用于供给特定任务模型的低维表示。我们引入MTC-VAE,一种自监督运动迁移VAE模型,用于从视频中解耦运动与内容。与先前视频内容-运动解耦工作不同,我们采用分块建模方法,并利用时空邻域中包含的运动信息。我们的模型产生保持时间一致性的独立逐块表示。因此,我们单次前向传播即可重建整个视频。我们扩展ELBO的对数似然项,并包含盲重演损失作为归纳偏置以利用运动解耦,其假设为交换运动特征会产生两视频间的重演。我们用近期提出的解耦度量评估我们的模型,并表明其优于多种视频运动-内容解耦方法。视频重演实验显示了我们的解耦在输入空间中的有效性,其中我们的模型在重建质量与运动对齐上优于基线。

关键词

引用

@article{arxiv.2102.00324,
  title  = {Video Reenactment as Inductive Bias for Content-Motion Disentanglement},
  author = {Juan F. Hernández Albarracín and Adín Ramírez Rivera},
  journal= {arXiv preprint arXiv:2102.00324},
  year   = {2022}
}

备注

Pre-print to appear in IEEE Trans. on Image Processing. Project page, high resolution images, and source code at https://mipl.gitlab.io/mtc-vae/