中文

通过混合Transformer聚合最近清晰特征用于视频去模糊

计算机视觉与模式识别 2024-12-02 v2

摘要

视频去模糊方法旨在从给定模糊视频中恢复连续的清晰帧,通常假设输入视频受到连续模糊帧的影响。然而,在现代成像设备捕获的真实场景中,清晰帧常散布于视频中,提供时间上最近的清晰特征,可辅助模糊帧的恢复。在这项工作中,我们提出一种视频去模糊方法,利用混合Transformer通过特征聚合来同时使用相邻帧与已有清晰帧。具体而言,我们首先训练一个模糊感知检测器以区分清晰与模糊帧。然后,采用基于窗口的局部Transformer从相邻帧提取特征,其中交叉注意力有利于在无显式空间对齐的情况下聚合相邻帧特征。为从检测到的清晰帧聚合最近清晰特征,我们利用具有多尺度匹配能力的全局Transformer。此外,通过将事件融合模块纳入全局Transformer,我们的方法可轻松扩展至事件驱动视频去模糊。在基准数据集上的大量实验表明,我们所提方法在量化指标与视觉质量上均优于最先进的视频去模糊方法及事件驱动视频去模糊方法。源代码与训练模型可在 https://github.com/shangwei5/STGTN 获取。

关键词

引用

@article{arxiv.2309.07054,
  title  = {Aggregating Nearest Sharp Features via Hybrid Transformers for Video Deblurring},
  author = {Wei Shang and Dongwei Ren and Yi Yang and Wangmeng Zuo},
  journal= {arXiv preprint arXiv:2309.07054},
  year   = {2024}
}

备注

Accepted by Information Sciences 2024, and the code is available at https://github.com/shangwei5/STGTN