中文

ViStripformer:面向通用视频恢复的令牌高效Transformer

计算机视觉与模式识别 2023-12-25 v1

摘要

视频恢复是一项低级视觉任务,旨在从质量退化的帧中恢复干净、清晰的视频。成功进行视频恢复需要利用相邻帧的时间信息。近年来,Transformer的成功引起了计算机视觉界的关注。然而,其自注意力机制需要大量内存,不适合视频恢复等高分辨率视觉任务。本文提出ViStripformer(Video Stripformer),它利用时空条带注意力捕捉长程数据相关性,包括帧内条带注意力(Intra-SA)和帧间条带注意力(Inter-SA),用于提取空间和时间信息。它将视频帧分解为水平和垂直方向的条带状特征,用于Intra-SA和Inter-SA,以处理具有不同方向和幅度的退化模式。此外,ViStripformer是一种高效且有效的Transformer架构,其内存使用量远低于普通Transformer。大量实验表明,所提模型在视频恢复任务(包括视频去模糊、去摩尔纹和去雨)上以快速推理时间取得了优越的结果。

关键词

引用

@article{arxiv.2312.14502,
  title  = {ViStripformer: A Token-Efficient Transformer for Versatile Video Restoration},
  author = {Fu-Jen Tsai and Yan-Tsung Peng and Chen-Yu Chang and Chan-Yu Li and Yen-Yu Lin and Chung-Chi Tsai and Chia-Wen Lin},
  journal= {arXiv preprint arXiv:2312.14502},
  year   = {2023}
}