中文

Mocycle-GAN:无配对视频到视频翻译

计算机视觉与模式识别 2019-08-27 v1 多媒体

摘要

无监督图像到图像翻译是在无任何配对训练样本的情况下将图像从一域翻译到另一域的任务,且往往更适用于实际应用场景。然而,此类合成从图像到图像扩展至视频到视频并非易事,尤其在捕获视频中的时空结构时。困难源于以下方面:不仅每帧中的视觉外观,而且连续帧之间的运动都应在变换中真实且一致。这促使我们探索视频合成中的外观结构与时间连续性。本文中,我们提出一种新的运动引导循环GAN,称为Mocycle-GAN,其新颖地将运动估计集成到无配对视频翻译器中。技术上,Mocycle-GAN利用三类约束:判别合成帧与真实帧的对抗约束、在帧与运动上鼓励逆翻译的循环一致性约束,以及验证连续帧间运动迁移的运动翻译约束。我们在视频到标签与标签到视频翻译上进行了大量实验,与SOTA方法相比报告了优越结果。更显著的是,我们定性地展示了我们的Mocycle-GAN在花到花以及环境条件下迁移上的效果。

关键词

引用

@article{arxiv.1908.09514,
  title  = {Mocycle-GAN: Unpaired Video-to-Video Translation},
  author = {Yang Chen and Yingwei Pan and Ting Yao and Xinmei Tian and Tao Mei},
  journal= {arXiv preprint arXiv:1908.09514},
  year   = {2019}
}

备注

Accepted as a full paper for ACMMM 2019