中文

重新思考视频超分辨率Transformer中的对齐

计算机视觉与模式识别 2022-10-11 v2

摘要

相邻帧的对齐被认为是视频超分辨率(VSR)中的一项基本操作。先进的VSR模型,包括最新的VSR Transformer,通常都配备了精心设计的对齐模块。然而,自注意力机制的进展可能违背这一常识。在本文中,我们重新思考了对齐在VSR Transformer中的作用,并做出了若干反直觉的观察。我们的实验表明:(i) VSR Transformer可以直接利用来自未对齐视频的多帧信息,以及(ii)现有的对齐方法有时对VSR Transformer是有害的。这些观察表明,我们可以通过移除对齐模块并采用更大的注意力窗口来进一步提升VSR Transformer的性能。然而,这样的设计将急剧增加计算负担,并且无法处理大幅运动。因此,我们提出了一种称为块对齐的新的高效对齐方法,该方法对齐图像块而非像素。配备块对齐的VSR Transformer能够在多个基准上展示出最先进的性能。我们的工作为如何理解VSR中多帧信息的利用以及如何为不同网络/数据集选择对齐方法提供了有价值的见解。代码和模型将在 https://github.com/XPixelGroup/RethinkVSRAlignment 发布。

关键词

引用

@article{arxiv.2207.08494,
  title  = {Rethinking Alignment in Video Super-Resolution Transformers},
  author = {Shuwei Shi and Jinjin Gu and Liangbin Xie and Xintao Wang and Yujiu Yang and Chao Dong},
  journal= {arXiv preprint arXiv:2207.08494},
  year   = {2022}
}

备注

This paper has been accepted for NeurIPS 2022