中文

具有引导可变形注意力的循环视频恢复Transformer

计算机视觉与模式识别 2022-11-15 v3 图像与视频处理

摘要

视频恢复旨在从多帧低质量帧中恢复出多帧高质量帧。现有的视频恢复方法通常落入两种极端情况,即要么并行恢复所有帧,要么以循环方式逐帧恢复视频,这将导致不同的优点和缺点。通常,前者具有时间信息融合的优势,但存在模型规模大和内存消耗高的问题;后者由于跨帧共享参数而模型规模相对较小,但缺乏长程依赖建模能力和可并行性。本文试图通过提出一种循环视频恢复Transformer(即RVRT)来整合两种情况的优势。RVRT在全球循环框架内并行处理局部相邻帧,从而在模型规模、有效性和效率之间实现良好权衡。具体而言,RVRT将视频划分为多个片段,并利用先前推断的片段特征来估计后续片段特征。在每个片段内,不同帧特征通过隐式特征聚合联合更新。在不同片段之间,设计引导可变形注意力用于片段到片段的对齐,其从整个推断片段中预测多个相关位置并通过注意力机制聚合其特征。在视频超分辨率、去模糊和去噪方面的大量实验表明,所提出的RVRT在基准数据集上以均衡的模型规模、测试内存和运行时间取得了最先进的性能。

关键词

引用

@article{arxiv.2206.02146,
  title  = {Recurrent Video Restoration Transformer with Guided Deformable Attention},
  author = {Jingyun Liang and Yuchen Fan and Xiaoyu Xiang and Rakesh Ranjan and Eddy Ilg and Simon Green and Jiezhang Cao and Kai Zhang and Radu Timofte and Luc Van Gool},
  journal= {arXiv preprint arXiv:2206.02146},
  year   = {2022}
}

备注

Accepted by NeurIPS 2022. Code: https://github.com/JingyunLiang/RVRT