STAR:用于现实视频超分辨率的空间-时间增强方法
计算机视觉与模式识别
2025-01-07 v1
摘要
图像扩散模型已被适用于现实视频超分辨率,以解决基于GAN的方法中的过平滑问题。然而,这些模型在维持时间一致性方面存在挑战,因为它们是在静态图像上训练的,限制了其有效捕捉时间动态能力。将文本到视频(T2V)模型集成到视频超分辨率中以实现更好的时间建模是直接的。然而,仍存在两个关键挑战:现实场景中复杂退化引入的噪声,以及强大的T2V模型(如CogVideoX-5B)的生成能力导致保真度受损。为增强恢复视频的时空质量,我们提出了一种新方法,称为STAR(Spatial-Temporal Augmentation with T2V models for Real-world video super-resolution),即利用T2V模型进行现实视频超分辨率,实现逼真的空间细节和稳健的时间一致性。具体而言,我们在全局注意力块之前引入了局部信息增强模块(LIEM),以丰富局部细节并缓解退化噪声。此外,我们提出了动态频率(DF)损失,以强化保真度,引导模型在扩散步骤中关注不同的频率成分。广泛的实验表明,STAR在合成数据集和现实数据集上均优于当前最先进的方法。
引用
@article{arxiv.2501.02976,
title = {STAR: Spatial-Temporal Augmentation with Text-to-Video Models for Real-World Video Super-Resolution},
author = {Rui Xie and Yinhong Liu and Penghao Zhou and Chen Zhao and Jun Zhou and Kai Zhang and Zhenyu Zhang and Jian Yang and Zhenheng Yang and Ying Tai},
journal= {arXiv preprint arXiv:2501.02976},
year = {2025}
}