中文

小片段,大增益:学习长程重聚焦时序信息用于视频超分辨率

计算机视觉与模式识别 2025-05-06 v1

摘要

视频超分辨率(VSR)通过额外利用时序信息,可以实现比单图像超分辨率更好的性能。特别是,基于循环的 VSR 模型在推理过程中利用长程时序信息,实现了卓越的细节恢复。然而,在长视频中有效学习这些长程依赖关系仍然是一个关键挑战。为解决此问题,我们提出了 LRTI-VSR,这是一种用于循环 VSR 的新型训练框架,能够高效利用长程重聚焦时序信息。我们的框架包含一种通用训练策略,该策略在较短视频片段上训练时,利用来自长视频片段的时序传播特征。此外,我们引入了一个重聚焦的帧内与帧间 Transformer 模块,使 VSR 模型能够通过其注意力模块选择性地优先处理有用的时序信息,同时在 FFN 模块中进一步提高帧间信息的利用率。我们在基于 CNN 和 Transformer 的 VSR 架构上评估了 LRTI-VSR,并进行了广泛的消融研究以验证每个组件的贡献。在长视频测试集上的实验表明,LRTI-VSR 在保持训练和计算效率的同时,达到了最先进的性能。

关键词

引用

@article{arxiv.2505.02159,
  title  = {Small Clips, Big Gains: Learning Long-Range Refocused Temporal Information for Video Super-Resolution},
  author = {Xingyu Zhou and Wei Long and Jingbo Lu and Shiyin Jiang and Weiyi You and Haifeng Wu and Shuhang Gu},
  journal= {arXiv preprint arXiv:2505.02159},
  year   = {2025}
}

备注

15 pages, 11 figures