中文

无监督视频到视频翻译

计算机视觉与模式识别 2018-06-12 v1

摘要

无监督图像到图像翻译是近期提出的一项任务,即在训练时仅给定未配对的图像样本,将图像翻译为不同的风格或域。在本文中,我们提出了无监督视频到视频翻译这一新任务,其具有自身独特的挑战。翻译视频意味着不仅要学习物体与场景的外观,还要学习连续的帧之间真实的运动与过渡。我们考察了使用现有图像到图像翻译网络进行逐帧视频到视频翻译的性能,并提出了一种时空三维翻译器作为该问题的替代方案。我们在多个合成数据集(如移动彩色数字)以及真实的分割到视频 GTA 数据集和一个新的 CT 到 MRI 体图像翻译数据集上评估了我们的三维方法。我们的结果表明,逐帧翻译在单帧层面上能产生真实的结果,但相较于我们的三维翻译方法,在整段视频的尺度上表现明显不佳,后者更能学习视频的复杂结构以及运动与物体外观的连续性。

关键词

引用

@article{arxiv.1806.03698,
  title  = {Unsupervised Video-to-Video Translation},
  author = {Dina Bashkirova and Ben Usman and Kate Saenko},
  journal= {arXiv preprint arXiv:1806.03698},
  year   = {2018}
}