具有掩码帧间和帧内注意力的视频超分辨率Transformer
计算机视觉与模式识别
2024-04-01 v4
摘要
最近,Vision Transformer在恢复低分辨率序列中缺失细节方面取得了巨大成功,即视频超分辨率(VSR)任务。尽管在VSR精度上具有优势,但沉重的计算负担和大的内存占用阻碍了基于Transformer的VSR模型在受限设备上的部署。本文通过提出一种新颖的特征级掩码处理框架:具有掩码帧内和帧间注意力的VSR(MIA-VSR)来解决上述问题。MIA-VSR的核心是利用相邻帧之间的特征级时间连续性来减少冗余计算,并更合理地利用先前增强的SR特征。具体地,我们提出了一个帧内和帧间注意力块,它考虑了先前特征和输入特征各自的作用,并且仅利用先前增强的特征来提供补充信息。此外,开发了一个自适应块级掩码预测模块,根据相邻帧之间的特征相似性跳过不重要的计算。我们进行了详细的消融研究以验证我们的贡献,并将所提出的方法与最新的VSR方法进行比较。实验结果表明,MIA-VSR在不牺牲PSNR精度的情况下,提高了内存和计算效率。代码可在https://github.com/LabShuHangGU/MIA-VSR获取。
引用
@article{arxiv.2401.06312,
title = {Video Super-Resolution Transformer with Masked Inter&Intra-Frame Attention},
author = {Xingyu Zhou and Leheng Zhang and Xiaorui Zhao and Keze Wang and Leida Li and Shuhang Gu},
journal= {arXiv preprint arXiv:2401.06312},
year = {2024}
}
备注
Accepted by CVPR 2024