中文

HyperCon:面向视频到视频翻译任务的图生视频模型迁移

计算机视觉与模式识别 2020-11-11 v2

摘要

由于时间一致性问题,若不加处理会导致令人分心的闪烁效应,视频到视频翻译比图像到图像翻译更困难。尽管从零设计的视频模型能产生时间一致的结果,但训练它们以匹配图像模型所捕获的庞大视觉知识需要数量难以处理的视频。为结合图像与视频模型的优势,我们提出一种称为超一致性(HyperCon)的图生视频模型迁移方法,可将任何训练良好的图像模型转化为时间一致的视频模型而无需微调。HyperCon 通过对时间插值视频逐帧翻译,然后在插值视频上基于时间局部窗口进行聚合来工作。它处理带掩码与不带掩码的输入,相比先前的图生视频模型迁移技术,可支持更多视频到视频翻译任务。我们在视频风格迁移与修复上展示了 HyperCon,与先前最先进方法相比表现良好,且无需在单个风格化或不完整视频上训练。我们的项目网站位于 https://ryanszeto.com/projects/hypercon 。

关键词

引用

@article{arxiv.1912.04950,
  title  = {HyperCon: Image-To-Video Model Transfer for Video-To-Video Translation Tasks},
  author = {Ryan Szeto and Mostafa El-Khamy and Jungwon Lee and Jason J. Corso},
  journal= {arXiv preprint arXiv:1912.04950},
  year   = {2020}
}

备注

Accepted to WACV 2021