无图像的视觉:基于单一压缩测量的端到端计算机视觉
计算机视觉与模式识别
2025-09-03 v3 人工智能
摘要
快照压缩成像(SCI)提供了高速、低带宽和节能的图像获取能力,但在低光照和低信噪比(SNR)条件下仍面临挑战。此外,高分辨率传感器的实际硬件限制限制了大帧大小遮罩的使用, necessitating 使用更小、硬件友好的设计。在本工作中,我们提出了一种 novel SCI 基于仅 88 大小的伪随机二进制遮罩的计算机视觉框架,以实现可行的物理实现。其核心是基于 STFormer 架构构建的压缩去噪自编码器(CompDAE),用于直接从噪声压缩原始像素测量中执行下游任务——如边缘检测和深度估计,而无需图像重建。CompDAE 采用受 BackSlash 启发的受限率训练策略,以促进紧凑、可压缩的模型。通过共享编码器配合轻量级任务特定解码器,实现统一的多任务平台。广泛的实验表明,CompDAE 在多个数据集上实现了在低复杂度下的领先性能,尤其是在传统 CMOS 和 SCI 管道失败的超低光照条件下。
引用
@article{arxiv.2501.15122,
title = {Vision without Images: End-to-End Computer Vision from Single Compressive Measurements},
author = {Fengpu Pan and Heting Gao and Jiangtao Wen and Yuxing Han},
journal= {arXiv preprint arXiv:2501.15122},
year = {2025}
}