中文

SAM能否提升视频超分辨率?

计算机视觉与模式识别 2023-05-15 v2

摘要

视频超分辨率(VSR)的主要挑战是处理输入帧中的大幅运动,这使得难以从多帧中准确聚合信息。现有工作要么采用可变形卷积,要么估计光流作为先验以建立帧间对应来实现有效对齐与融合。然而,它们未考虑可极大增强该过程的有价值语义信息;且基于流的方法严重依赖流估计模型的准确性,给定两帧低分辨率图像时该模型可能无法提供精确光流。本文中,我们利用 Segment Anything Model(SAM,一个不易受图像退化影响的强大基础模型)研究一种更鲁棒且语义感知的先验以增强 VSR。为使用基于 SAM 的先验,我们提出了一个简单而有效的模块——SAM引导细化模块(SEEM),其可通过利用语义信息增强对齐与融合过程。该轻量级插件模块专门设计用于不仅借助注意力机制生成语义感知特征,而且可轻松无缝集成到现有方法中。具体而言,我们将 SEEM 应用于两种代表性方法 EDVR 和 BasicVSR,以极小实现代价在三个广泛使用的 VSR 数据集 Vimeo-90K、REDS 和 Vid4 上获得一致性能提升。更重要的是,我们发现所提 SEEM 能以高效调参方式改进现有方法,为调整性能与训练参数数量间平衡提供了更大灵活性。代码将很快开源。

关键词

引用

@article{arxiv.2305.06524,
  title  = {Can SAM Boost Video Super-Resolution?},
  author = {Zhihe Lu and Zeyu Xiao and Jiawang Bai and Zhiwei Xiong and Xinchao Wang},
  journal= {arXiv preprint arXiv:2305.06524},
  year   = {2023}
}

备注

Technical Report