中文

面向视频超分辨率的学习轨迹感知 Transformer

图像与视频处理 2022-04-21 v3 计算机视觉与模式识别

摘要

视频超分辨率(VSR)旨在从低分辨率(LR)帧序列中恢复出高分辨率(HR)帧序列。尽管已取得一定进展,如何有效利用整个视频序列中的时间依赖性仍面临巨大挑战。现有方法通常仅对齐并聚合有限相邻帧(如 5 或 7 帧)的视频帧,这阻碍了这些方法获得令人满意的结果。在本文中,我们更进一步以实现视频中有效的时空学习。我们提出了一种新颖的面向视频超分辨率的轨迹感知 Transformer(TTVSR)。具体而言,我们将视频帧构建为若干由连续视觉 token 组成的预对齐轨迹。对于查询 token,自注意力仅在沿时空轨迹的相关视觉 token 上学习。与原始视觉 Transformer 相比,此类设计显著降低了计算成本,并使 Transformer 能够建模长程特征。我们进一步提出跨尺度特征 token 化模块,以克服长程视频中经常出现的尺度变化问题。实验结果表明,在四个广泛使用的视频超分辨率基准上通过大量定量与定性评估,所提 TTVSR 优于最先进模型。代码与预训练模型均可在 https://github.com/researchmm/TTVSR 下载。

关键词

引用

@article{arxiv.2204.04216,
  title  = {Learning Trajectory-Aware Transformer for Video Super-Resolution},
  author = {Chengxu Liu and Huan Yang and Jianlong Fu and Xueming Qian},
  journal= {arXiv preprint arXiv:2204.04216},
  year   = {2022}
}

备注

CVPR 2022 Oral