语义透镜:面向视频超分辨率的实例中心语义对齐
计算机视觉与模式识别
2024-01-22 v4
摘要
作为视频超分辨率(VSR)的关键线索,帧间对齐显著影响整体性能。然而,由于视频中复杂的运动交织,精确的像素级对齐是一项具有挑战性的任务。针对这一问题,我们引入了一种名为语义透镜的 VSR 新范式,该范式基于从退化视频中提取的语义先验。具体来说,视频通过语义提取器被建模为实例、事件和场景。这些语义辅助像素增强器理解恢复的内容并生成更逼真的视觉结果。提取的全局语义体现了每一帧的场景信息,而实例特定语义则汇集了与每个实例相关的时空上下文。此外,我们设计了一个语义驱动的注意力交叉嵌入(SPACE)模块,以连接像素级特征与语义知识,该模块由一个全局视角转换器(GPS)和一个实例特定语义嵌入编码器(ISEE)组成。具体而言,GPS 模块以全局语义为条件,为像素级特征调制生成仿射变换参数对。之后,ISEE 模块利用注意力机制在实例中心的语义空间中对齐相邻帧。此外,我们还引入了一个简单而有效的预对齐模块,以减轻模型训练的难度。大量实验证明了我们的模型优于现有最先进的 VSR 方法。
引用
@article{arxiv.2312.07823,
title = {Semantic Lens: Instance-Centric Semantic Alignment for Video Super-Resolution},
author = {Qi Tang and Yao Zhao and Meiqin Liu and Jian Jin and Chao Yao},
journal= {arXiv preprint arXiv:2312.07823},
year = {2024}
}
备注
Accepted to AAAI 2024