无需稠密张量:事件相机体素网格上的全稀疏目标检测
计算机视觉与模式识别
2026-03-24 v1
摘要
事件相机产生异步、高动态范围的流,非常适合检测小型、快速移动的无人机,然而大多数基于事件的检测器将稀疏事件流转换为稠密张量,丢弃了神经形态感知的表示效率。我们提出了SparseVoxelDet,据我们所知,这是第一个用于事件相机的全稀疏目标检测器,其中骨干特征提取、特征金字塔融合和检测头都通过3D稀疏卷积仅在占用的体素位置上运行;在流程的任何阶段都不实例化稠密特征张量。在FRED基准测试(629,832个标注帧)上,SparseVoxelDet在IoU阈值为50时达到了83.38%的mAP,同时每帧仅处理14,900个活跃体素(占T.H.W网格的0.23%),而稠密的YOLOv11基线(IoU阈值为50时mAP为87.68%)需要处理409,600个像素。将IoU阈值从0.50放宽到0.40可将mAP恢复到89.26%,这表明剩余的精度差距主要由边界框回归精度而非检测能力主导。与等效的稠密3D体素张量相比,稀疏表示实现了858倍的GPU内存压缩和3,670倍的存储减少,其数据结构大小随场景动态而非传感器分辨率缩放。对119,459个测试帧的错误分析证实,71%的失败是定位接近失误而非漏检目标。这些结果表明,原生稀疏处理是事件相机目标检测的一种可行范式,它利用了神经形态传感器数据的结构稀疏性,而无需神经形态计算硬件,并提供了一个其表示成本由场景活动而非像素数量决定的框架,这一特性随着事件相机向更高分辨率扩展而变得越来越有价值。
引用
@article{arxiv.2603.21638,
title = {No Dense Tensors Needed: Fully Sparse Object Detection on Event-Camera Voxel Grids},
author = {Mohamad Yazan Sadoun and Sarah Sharif and Yaser Mike Banad},
journal= {arXiv preprint arXiv:2603.21638},
year = {2026}
}
备注
29 Pages, 9 Figures, 5 Tables