中文

用于快照压缩成像的层次可分离视频变换器

计算机视觉与模式识别 2024-07-18 v2

摘要

变换器在解决快照压缩成像(SCI)的视频逆问题时取得了最佳性能,其不可逆性源于空间掩码和时间别名的混合退化。然而,之前的变换器缺乏对退化性质的理解,导致性能和效率受限。本文构建了一个在早期层次中不进行时间聚合的高效重建架构,作为构建模块的 HiSViT。HiSViT 由多个交叉尺度可分离多头自注意力(CSS-MSA)和掩门自调制前馈网络(GSM-FFN)组成,这些组件通过稠密连接,分别在不同尺度的独立通道部分内进行,以实现多尺度相互作用和长程建模。通过将空间操作与时间操作分离,CSS-MSA 引入了在帧内而非帧间更关注注意力的归纳偏置,从而节省了计算开销。GSM-FFN 通过掩门机制和分解空间时间卷积进一步增强了局部性。大量实验表明,我们的方法在可比或更少参数和复杂度的情况下超过以前的方法,性能提升超过 0.5 dB。源代码和预训练模型已发布于 https://github.com/pwangcs/HiSViT。

关键词

引用

@article{arxiv.2407.11946,
  title  = {Hierarchical Separable Video Transformer for Snapshot Compressive Imaging},
  author = {Ping Wang and Yulun Zhang and Lishun Wang and Xin Yuan},
  journal= {arXiv preprint arXiv:2407.11946},
  year   = {2024}
}

备注

Accepted by ECCV 2024