中文

通过合成光流伪监督学习时空与语义一致的非配对视频到视频翻译

计算机视觉与模式识别 2022-12-22 v3

摘要

非配对视频到视频翻译旨在无需配对训练数据的情况下将视频在源域与目标域之间进行转换,从而更适用于实际应用场景。然而,翻译后的视频通常存在时序与语义不一致的问题。为此,许多现有工作采用基于运动估计的时空一致性约束来引入时间信息。但是,运动估计的不准确会恶化对时空一致性的引导质量,导致翻译不稳定。本文提出一种新颖的范式,通过用生成的光流合成输入视频中的运动,而非估计运动,来正则化时空一致性。因此,合成运动可用于该正则化范式,以跨域保持运动一致,且无需承担运动估计错误的风险。此后,我们利用由合成光流提供的伪监督所引导的无监督循环损失与无监督空间损失,在两个域中精确强制时空一致性。实验表明,我们的方法在多种场景下具有通用性,并在生成时序与语义一致视频方面取得了最先进的性能。代码见:https://github.com/wangkaihong/Unsup_Recycle_GAN/。

关键词

引用

@article{arxiv.2201.05723,
  title  = {Learning Temporally and Semantically Consistent Unpaired Video-to-video Translation Through Pseudo-Supervision From Synthetic Optical Flow},
  author = {Kaihong Wang and Kumar Akash and Teruhisa Misu},
  journal= {arXiv preprint arXiv:2201.05723},
  year   = {2022}
}