LUM-ViT: 用于带宽受限光学信号采集的可学习欠采样掩码视觉Transformer
计算机视觉与模式识别
2024-03-05 v1 图像与视频处理
信号处理
摘要
信号采集过程中的带宽限制经常阻碍实时检测应用。高光谱数据是一个显著的例子,其庞大的体积损害了实时高光谱检测。为了解决这一障碍,我们引入了一种新颖的方法,利用采集前调制来减少采集量。该调制过程由深度学习模型控制,利用先验信息。我们方法的核心是LUM-ViT,一种Vision Transformer变体。独特的是,LUM-ViT包含一个为采集前调制量身定制的可学习欠采样掩码。为了进一步优化光学计算,我们提出了一种核级权重二值化技术和三阶段微调策略。我们的评估表明,通过仅采样原始图像像素的10%,LUM-ViT在ImageNet分类任务上将准确率损失保持在1.8%以内。该方法在实际光学硬件上实现时保持了接近原始的准确率,证明了其实用性。代码将在https://github.com/MaxLLF/LUM-ViT提供。
引用
@article{arxiv.2403.01412,
title = {LUM-ViT: Learnable Under-sampling Mask Vision Transformer for Bandwidth Limited Optical Signal Acquisition},
author = {Lingfeng Liu and Dong Ni and Hangjie Yuan},
journal= {arXiv preprint arXiv:2403.01412},
year = {2024}
}
备注
Accepted to ICLR 2024