中文

用于视频快照压缩成像的时空 Transformer

图像与视频处理 2022-09-09 v2 计算机视觉与模式识别

摘要

视频快照压缩成像(SCI)利用计算成像思想,通过单次测量捕获多帧连续视频帧。其基本原理是用不同掩模调制高速帧,这些被调制的帧求和得到由低速 2D 传感器捕获的单次测量(称为光学编码器);随后,如需恢复所需高速帧,则采用算法进行重建(称为软件解码器)。本文研究视频 SCI 中的重建算法,即从压缩测量中恢复一系列视频帧。具体地,我们提出一种时空 Transformer(STFormer)以利用空间与时间域的相关性。STFormer 网络由令牌生成块、视频重建块组成,且这两个块由一系列 STFormer 块连接。每个 STFormer 块包含一个空间自注意力分支、一个时间自注意力分支,两分支输出由融合网络整合。在仿真与真实数据上的大量结果表明了 STFormer 的 SOTA 性能。代码与模型已公开于 https://github.com/ucaswangls/STFormer.git

关键词

引用

@article{arxiv.2209.01578,
  title  = {Spatial-Temporal Transformer for Video Snapshot Compressive Imaging},
  author = {Lishun Wang and Miao Cao and Yong Zhong and Xin Yuan},
  journal= {arXiv preprint arXiv:2209.01578},
  year   = {2022}
}