中文

在扩散模型中学习空间自适应与时间一致性以实现视频超分辨率

计算机视觉与模式识别 2024-03-26 v1 多媒体

摘要

扩散模型在图像超分辨率任务上正处于关键转折点。然而,将扩散模型应用于视频超分辨率并非易事,这不仅需要保持从低分辨率到高分辨率视频的视觉外观,还需要保持视频帧之间的时间一致性。在本文中,我们提出了一种新方法,致力于空间自适应与时间一致性(SATeCo),用于视频超分辨率。SATeCo 的核心在于从低分辨率视频中学习时空指导,以校准潜空间的高分辨率视频去噪和像素空间的视频重建。在技术上,SATeCo 冻结了预训练 UNet 和 VAE 的所有参数,仅在 UNet 和 VAE 的解码器中优化两个专门设计的空间特征自适应(SFA)和时间特征对齐(TFA)模块。SFA 通过自适应估计每个像素的仿射参数来调制帧特征,为高分辨率帧合成提供像素级指导。TFA 通过自注意力深入研究 3D 局部窗口(tubelet)内的特征交互,并在 tubelet 及其对应的低分辨率特征之间执行交叉注意力以指导时间特征对齐。在 REDS4 和 Vid4 数据集上进行的大量实验证明了我们方法的有效性。

关键词

引用

@article{arxiv.2403.17000,
  title  = {Learning Spatial Adaptation and Temporal Coherence in Diffusion Models for Video Super-Resolution},
  author = {Zhikai Chen and Fuchen Long and Zhaofan Qiu and Ting Yao and Wengang Zhou and Jiebo Luo and Tao Mei},
  journal= {arXiv preprint arXiv:2403.17000},
  year   = {2024}
}

备注

CVPR 2024