中文

潜在扩散空间中的语义与时间集成用于高保真视频超分辨率

计算机视觉与模式识别 2025-08-04 v1 图像与视频处理

摘要

视频超分辨率(VSR)模型的最新进展在提升低分辨率视频方面取得了令人瞩目的成果。然而,由于在充分控制生成过程方面存在局限性,实现与低分辨率输入高度对齐的同时在帧之间保持时间一致性仍然是一个重大挑战。本文提出了一种语义和时间引导的视频超分辨率方法(SeTe-VSR),该方法在潜在扩散空间中融合了语义信息和时空信息以解决这些挑战。通过融合高层语义信息和整合空间与时间信息,该方法实现了在恢复细节与确保时间连贯性之间实现无缝平衡。该方法不仅保留了高真实感视觉内容,还显著提升了保真度。大量实验表明,SeTe-VSR在细节恢复和感知质量方面均优于现有方法,凸显其在复杂视频超分辨率任务中的有效性。

关键词

引用

@article{arxiv.2508.00471,
  title  = {Semantic and Temporal Integration in Latent Diffusion Space for High-Fidelity Video Super-Resolution},
  author = {Yiwen Wang and Xinning Chai and Yuhong Zhang and Zhengxue Cheng and Jun Zhao and Rong Xie and Li Song},
  journal= {arXiv preprint arXiv:2508.00471},
  year   = {2025}
}