中文

ALANET: 用于联合视频去模糊与插值的自适应潜空间注意力网络

计算机视觉与模式识别 2020-09-03 v1 机器学习 图像与视频处理

摘要

现有工作通过分别学习帧去模糊和帧插值模块来解决生成高帧率清晰视频的问题。这些方法大多有一个强先验假设,即所有输入帧都是模糊的,而在真实场景中,帧的质量是变化的。此外,这类方法被训练为孤立地执行去模糊或插值两项任务之一,而许多实际情况需要两者兼具。与这些工作不同,我们解决了一个更现实的问题:高帧率清晰视频合成,且不先验假设输入总是模糊的。我们提出了一种新颖的架构——自适应潜空间注意力网络(ALANET),它在无需预先知道输入帧是否模糊的情况下合成清晰的高帧率视频,从而同时执行去模糊和插值任务。我们假设连续帧的潜表示中的信息可用于生成针对帧去模糊和帧插值的优化表示。具体而言,我们在潜空间中对连续帧采用自注意力和交叉注意力模块的组合,以为每帧生成优化表示。利用这些注意力模块学习到的优化表示有助于模型生成和插值清晰帧。在标准数据集上的大量实验表明,尽管我们处理的是一个困难得多的问题,我们的方法仍优于各种最先进的方法。

关键词

引用

@article{arxiv.2009.01005,
  title  = {ALANET: Adaptive Latent Attention Network forJoint Video Deblurring and Interpolation},
  author = {Akash Gupta and Abhishek Aich and Amit K. Roy-Chowdhury},
  journal= {arXiv preprint arXiv:2009.01005},
  year   = {2020}
}

备注

Accepted to ACM-MM 2020