STCDiT:基于时空一致性扩散 Transformer 的高质量视频超分辨率
计算机视觉与模式识别
2025-11-25 v1
摘要
我们提出了 STCDiT,一款基于预训练视频扩散模型的视频超分辨率框架,旨在从退化输入中恢复结构忠实且时序稳定的视频,即使面临复杂的镜头运动。主要挑战在于在重建过程中维持时序稳定性,同时在生成过程中保持结构忠实性。为此,我们首先发展了感知运动的 VAE 重建方法,通过分段重建,每段剪辑展现均匀的运动特征,从而有效处理复杂镜头运动的视频。此外,我们发现每段剪辑中由 VAE 编码器提取的首帧潜变量(称为锚帧潜变量)不受时间压缩影响,保留的空间结构信息丰富于后续帧潜变量。我们进一步发展了锚帧引导方法,利用锚帧的结构信息约束生成过程,提高视频特征的结构忠实性。将这两种设计耦合在一起,使视频扩散模型能够实现高质量的视频超分辨率。大量实验表明,STCDiT 在结构忠实性和时序一致性方面均优于当前最先进的方法。
引用
@article{arxiv.2511.18786,
title = {STCDiT: Spatio-Temporally Consistent Diffusion Transformer for High-Quality Video Super-Resolution},
author = {Junyang Chen and Jiangxin Dong and Long Sun and Yixin Yang and Jinshan Pan},
journal= {arXiv preprint arXiv:2511.18786},
year = {2025}
}
备注
Project page: https://jychen9811.github.io/STCDiT_page