中文

I2V-GAN:非配对红外到可见光视频翻译

计算机视觉与模式识别 2021-08-05 v2

摘要

人类视觉常受复杂环境因素的不利影响,尤其在夜视场景中。因此,常利用红外相机通过探测周围环境的红外辐射来增强视觉效果,但红外视频因缺乏细致的语义信息而不尽如人意。在此情况下,亟需一种有效的从红外域到可见光域的视频到视频翻译方法,以克服红外与可见光领域间固有的巨大鸿沟。为应对这一挑战性问题,我们提出一种红外到可见光(I2V)视频翻译方法 I2V-GAN,由给定的非配对红外视频生成细粒度且时空一致的可见光视频。在技术层面,我们的模型利用三类约束:1)对抗约束以生成与真实帧相似的合成帧;2)引入感知损失的循环一致性以实现有效的内容转换与风格保持;3)跨域与域内相似性约束以在细粒度层面上增强空间与时间空间中的内容与运动一致性。此外,当前公开的红外与可见光数据集主要用于目标检测或跟踪,且部分为不连续图像,不适合视频任务。为此,我们提供了一个用于 I2V 视频翻译的新数据集 IRVI。具体而言,其包含 12 段车辆与监控场景的连续视频片段,红外与可见光视频均可拆分为 24352 帧。综合实验验证,I2V-GAN 在 I2V 视频翻译中优于对比的 SOTA 方法,具有更高的流畅度与更细的语义细节。代码与 IRVI 数据集可在 https://github.com/BIT-DA/I2V-GAN 获取。

关键词

引用

@article{arxiv.2108.00913,
  title  = {I2V-GAN: Unpaired Infrared-to-Visible Video Translation},
  author = {Shuang Li and Bingfeng Han and Zhenjie Yu and Chi Harold Liu and Kai Chen and Shuigen Wang},
  journal= {arXiv preprint arXiv:2108.00913},
  year   = {2021}
}

备注

Accepted at ACM MM 2021