中文

DualX-VSR:用于无运动补偿的实用视频超分辨率的双轴空间×时间 Transformer

计算机视觉与模式识别 2025-06-16 v2

摘要

Transformer 模型如 ViViT 和 TimeSformer 已通过有效建模时空依赖性,推动了视频理解的进展。近期视频生成模型(如 Sora 和 Vidu)进一步凸显了 Transformer 在长程特征提取和整体时空建模方面的潜力。然而,直接将这些模型应用于实际视频超分辨率(VSR)存在挑战,因为 VSR 需要像素级精度,而标记化和顺序注意力机制可能妥协其实现。虽然最近的基于 Transformer 的 VSR 模型尝试通过采用更小的补丁和局部注意力来解决此问题,但仍面临着受限感受野和依赖光束法对齐的问题,这在实际场景下可能引入误差。为克服此问题,我们提出了用于实用视频超分辨率的双轴空间×时间 Transformer(DualX-VSR),其引入一种新颖的双轴空间×时间注意力机制,将沿正交方向整合空间和时间信息。DualX-VSR 无需运动补偿,结构更为简化,能够提供时空信息的统一表征。因此,DualX-VSR 在实际 VSR 任务中实现了高保真度和卓越的性能。

关键词

引用

@article{arxiv.2506.04830,
  title  = {DualX-VSR: Dual Axial Spatial$\times$Temporal Transformer for Real-World Video Super-Resolution without Motion Compensation},
  author = {Shuo Cao and Yihao Liu and Xiaohui Li and Yuanting Gao and Yu Zhou and Chao Dong},
  journal= {arXiv preprint arXiv:2506.04830},
  year   = {2025}
}

备注

15 pages, 9 figures