中文

双尺度Transformer用于大规模单像素成像

计算机视觉与模式识别 2024-04-09 v1

摘要

单像素成像(SPI)是一种潜在的计算成像技术,它通过从单像素探测器捕获的少量测量值中解决不适定重建问题来生成图像。深度学习在SPI重建中取得了令人瞩目的成功。然而,以往较差的重建性能和不切实际的成像模型限制了其实际应用。在本文中,我们提出了一种基于Kronecker SPI模型的混合注意力Transformer深度展开网络,称为HATNet,以提高真实SPI相机的成像质量。具体来说,我们将迭代收缩阈值算法(ISTA)的计算图展开为两个交替模块:高效张量梯度下降和混合注意力多尺度去噪。借助Kronecker SPI,梯度下降模块可以避免基于向量化SPI的先前梯度下降模块中固有的高计算开销。去噪模块是一种编码器-解码器架构,由双尺度空间注意力(用于高低频聚合)和通道注意力(用于全局信息重新校准)驱动。此外,我们构建了一个SPI原型来验证所提出方法的有效性。在合成数据和真实数据上的大量实验表明,我们的方法达到了最先进的性能。源代码和预训练模型可在https://github.com/Gang-Qu/HATNet-SPI获取。

关键词

引用

@article{arxiv.2404.05001,
  title  = {Dual-Scale Transformer for Large-Scale Single-Pixel Imaging},
  author = {Gang Qu and Ping Wang and Xin Yuan},
  journal= {arXiv preprint arXiv:2404.05001},
  year   = {2024}
}

备注

CVPR 2024