中文

卷积神经网络(CNN)与视觉 Transformer(ViT)在数字全息中的应用比较

计算机视觉与模式识别 2022-01-28 v4 图像与视频处理

摘要

在数字全息(DH)中,从全息图提取物体距离以重建其振幅与相位至关重要。该步骤称为自动调焦,传统上先重建一叠图像,再利用熵或方差等聚焦度量使每幅重建图像锐化,最清晰图像对应的距离被视为焦点位置。该方法虽有效,但计算量大且耗时。本文利用深度学习(DL)确定该距离,比较了两种深度学习架构:卷积神经网络(CNN)与视觉 Transformer(ViT)。ViT 与 CNN 均将自动调焦作为分类问题处理。与文献[11]中相邻类别间距为 100μ\mum 的首次尝试相比,我们的方案将该距离大幅降至 1μ\mum。此外,ViT 达到了相近精度且比 CNN 更具鲁棒性。

关键词

引用

@article{arxiv.2108.09147,
  title  = {Convolutional Neural Network (CNN) vs Vision Transformer (ViT) for Digital Holography},
  author = {Stéphane Cuenat and Raphaël Couturier},
  journal= {arXiv preprint arXiv:2108.09147},
  year   = {2022}
}

备注

6 pages, 11 figures, ICCCR 2022 Conference