中文

用于视频快照压缩成像的卷积-Transformer 混合先验与不确定性估计展开框架

计算机视觉与模式识别 2023-06-21 v1 人工智能

摘要

我们考虑视频快照压缩成像(SCI)问题,其中连续高速帧被不同掩模调制并由单次测量捕获。从仅一次测量重建多帧图像的基本原理是求解一个病态问题。通过结合优化算法与神经网络,深度展开网络(DUNs)在求解逆问题上取得了巨大成就。本文中,我们提出的模型基于 DUN 框架,并提出了一种三维卷积-Transformer 混合(CTM)模块,其中插入了三维高效可扩展注意力模型,借助 Transformer 充分学习时间与空间维度间的相关性。据我们所知,这是 Transformer 首次被用于视频 SCI 重建。此外,为进一步探究先前研究忽略的重建过程中的高频信息,我们引入方差估计以逐像素刻画不确定性。大量实验结果表明,我们所提方法取得了最先进(SOTA)(相较先前 SOTA 算法在 PSNR 上提升 1.2dB)的结果。我们将发布代码。

关键词

引用

@article{arxiv.2306.11316,
  title  = {Unfolding Framework with Prior of Convolution-Transformer Mixture and Uncertainty Estimation for Video Snapshot Compressive Imaging},
  author = {Siming Zheng and Xin Yuan},
  journal= {arXiv preprint arXiv:2306.11316},
  year   = {2023}
}