中文

基于自监督学习的无监督多模态视频到视频翻译

计算机视觉与模式识别 2020-04-15 v1 机器学习 图像与视频处理

摘要

现有的无监督视频到视频翻译方法无法生成逐帧真实、保留语义信息且视频级一致的翻译视频。本文提出 UVIT,一种新颖的无监督视频到视频翻译模型。我们的模型分解风格与内容,使用专门的编码器-解码器结构,并通过双向循环神经网络(RNN)单元传播帧间信息。风格-内容分解机制使我们能够实现风格一致的视频翻译结果,并为我们提供了用于模态灵活翻译的良好接口。此外,通过改变翻译中输入的帧和风格编码,我们提出一种视频插值损失,其捕获序列内的时间信息以自监督方式训练我们的构建模块。我们的模型能够以多模态方式生成照片级真实、时空一致的翻译视频。主观与客观实验结果验证了我们的模型相对于现有方法的优越性。更多细节可在我们的项目网站查看:https://uvit.netlify.com

关键词

引用

@article{arxiv.2004.06502,
  title  = {Unsupervised Multimodal Video-to-Video Translation via Self-Supervised Learning},
  author = {Kangning Liu and Shuhang Gu and Andres Romero and Radu Timofte},
  journal= {arXiv preprint arXiv:2004.06502},
  year   = {2020}
}