中文

学习用于压缩视频超分辨率的空间-时间-频率 Transformer

计算机视觉与模式识别 2022-08-08 v1

摘要

压缩视频超分辨率(VSR)旨在从压缩的低分辨率对应帧中恢复高分辨率帧。近期大多数 VSR 方法常通过从相邻视频帧借用相关纹理来增强输入帧。尽管已取得一些进展,但从多数帧通常高度退化的压缩视频中有效提取并传递高质量纹理仍存在巨大挑战。本文提出一种用于压缩视频超分辨率的新型 Frequency-Transformer (FTVSR),其在联合时空频域上执行自注意力。首先,我们将视频帧划分为块,并将每个块变换为 DCT 频谱图,其中每个通道代表一个频带。该设计实现了对每个频带的细粒度自注意力,从而能将真实视觉纹理与伪影区分开,并进一步用于视频帧复原。其次,我们研究了不同的自注意力方案,发现一种先执行联合空间-频率注意力、再在每个频带上施加时间注意力的分离注意力可带来最佳的视频增强质量。在两个广泛使用的视频超分辨率基准上的实验结果表明,FTVSR 在压缩与未压缩视频上均以明显的视觉优势优于最先进的方法。代码见 https://github.com/researchmm/FTVSR。

关键词

引用

@article{arxiv.2208.03012,
  title  = {Learning Spatiotemporal Frequency-Transformer for Compressed Video Super-Resolution},
  author = {Zhongwei Qiu and Huan Yang and Jianlong Fu and Dongmei Fu},
  journal= {arXiv preprint arXiv:2208.03012},
  year   = {2022}
}

备注

ECCV2022