中文

RSTT:面向时空视频超分辨率的实时时空Transformer

计算机视觉与模式识别 2022-03-29 v1

摘要

时空视频超分辨率(STVSR)旨在将同时具有低帧率(LFR)和低分辨率(LR)的视频插值为高帧率(HFR)且高分辨率(HR)的对应视频。现有基于卷积神经网络(CNN)的方法取得了视觉上令人满意的结果,但由于其沉重的架构而推理速度慢。我们提出通过使用一个时空Transformer来解决此问题,该Transformer自然地将空间和时间超分辨率模块整合到单一模型中。与基于CNN的方法不同,我们不为时间插值和空间超分辨率显式使用分离的构建块;相反,我们仅使用单一的端到端Transformer架构。具体而言,编码器基于输入的LFR和LR帧构建一个可复用字典,随后在解码器部分用于合成HFR和HR帧。与最先进的TMNet \cite{xu2021temporal}相比,我们的网络参数量小60%60\%(4.5M对比12.3M),速度快80%80\%(在720×576720\times576帧上26.2fps对比14.3fps),且性能损失不大。源代码见 https://github.com/llmpass/RSTT。

关键词

引用

@article{arxiv.2203.14186,
  title  = {RSTT: Real-time Spatial Temporal Transformer for Space-Time Video Super-Resolution},
  author = {Zhicheng Geng and Luming Liang and Tianyu Ding and Ilya Zharkov},
  journal= {arXiv preprint arXiv:2203.14186},
  year   = {2022}
}