中文

LiftVSR:通过混合时序建模将图像扩散提升至视频超分辨率(仅需4×RTX 4090)

计算机视觉与模式识别 2025-06-11 v1

摘要

扩散模型通过精心设计的时序建模显著推动了视频超分辨率(VSR),以增强感知质量,但现有方法通常受限于时序一致性和高计算成本(例如,通常需要超过8个NVIDIA A100-80G GPU)。本文提出LiftVSR,一个高效VSR框架,利用并提升PixArt-α\alpha中图像级扩散先验,仅需4×RTX 4090 GPU即可实现最先进的结果。为平衡长期一致性和效率,我们引入混合时序建模机制,将时序学习分解为两个互补组件:(i)用于短帧段内细粒度时序建模的动态时序注意力(DTA),(ii)用于跨段长期时序建模的注意力内存缓存(AMC)。具体而言,DTA通过多头查询和键token识别多个跨帧token流,以变形价值token中的帧间上下文。AMC通过缓存单元自适应聚合历史段信息,确保以最小开销实现长期一致性。为进一步稳定推理期间的缓存交互,我们引入非对称抽样策略,以缓解不同扩散抽样步骤导致的特征不匹配。广泛的实验在几个典型VSR基准上表明,LiftVSR以显著更低的计算成本实现了令人瞩目的性能。

关键词

引用

@article{arxiv.2506.08529,
  title  = {LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\times$RTX 4090s},
  author = {Xijun Wang and Xin Li and Bingchen Li and Zhibo Chen},
  journal= {arXiv preprint arXiv:2506.08529},
  year   = {2025}
}

备注

Project page: https://kopperx.github.io/projects/liftvsr