卷积神经网络(CNN)与视觉 Transformer(ViT)在数字全息中的应用比较
计算机视觉与模式识别
2022-01-28 v4 图像与视频处理
摘要
在数字全息(DH)中,从全息图提取物体距离以重建其振幅与相位至关重要。该步骤称为自动调焦,传统上先重建一叠图像,再利用熵或方差等聚焦度量使每幅重建图像锐化,最清晰图像对应的距离被视为焦点位置。该方法虽有效,但计算量大且耗时。本文利用深度学习(DL)确定该距离,比较了两种深度学习架构:卷积神经网络(CNN)与视觉 Transformer(ViT)。ViT 与 CNN 均将自动调焦作为分类问题处理。与文献[11]中相邻类别间距为 100m 的首次尝试相比,我们的方案将该距离大幅降至 1m。此外,ViT 达到了相近精度且比 CNN 更具鲁棒性。
引用
@article{arxiv.2108.09147,
title = {Convolutional Neural Network (CNN) vs Vision Transformer (ViT) for Digital Holography},
author = {Stéphane Cuenat and Raphaël Couturier},
journal= {arXiv preprint arXiv:2108.09147},
year = {2022}
}
备注
6 pages, 11 figures, ICCCR 2022 Conference