中文

STDAN:用于时空视频超分辨率的可变形注意力网络

计算机视觉与模式识别 2025-09-12 v2

摘要

时空视频超分辨率(STVSR)的目标是提升低分辨率(LR)与低帧率(LFR)视频的时空分辨率。近期基于深度学习的方法取得了显著改进,但其中多数仅使用两相邻帧(即短期特征)来合成缺失帧嵌入,无法充分挖掘连续输入 LR 帧的信息流。此外,现有 STVSR 模型几乎未显式利用时间上下文以辅助高分辨率(HR)帧重建。为解决这些问题,本文提出一种称为 STDAN 的可变形注意力网络用于 STVSR。首先,我们设计了一种长短时特征插值(LSTFI)模块,能够通过双向 RNN 结构在插值过程中从更多邻近输入帧中挖掘丰富内容。其次,我们提出时空可变形特征聚合(STDFA)模块,其中动态视频帧中的空间与时间上下文被自适应捕获并聚合以增强 SR 重建。在多个数据集上的实验结果表明,我们的方法优于最先进的 STVSR 方法。代码见 https://github.com/littlewhitesea/STDAN。

关键词

引用

@article{arxiv.2203.06841,
  title  = {STDAN: Deformable Attention Network for Space-Time Video Super-Resolution},
  author = {Hai Wang and Xiaoyu Xiang and Yapeng Tian and Wenming Yang and Qingmin Liao},
  journal= {arXiv preprint arXiv:2203.06841},
  year   = {2025}
}