面向云边协同的多模态3D目标检测特征压缩
图像与视频处理
2024-09-09 v1
摘要
机器视觉系统能够高效地处理大规模的视觉感知任务,正在在工业生产和日常生活中日益流行。由于单一传感器难以同时获取准确的深度和纹理信息,通常会采用由摄像机和激光雷达捕获的多模态数据来提升性能。此外,云边协同方法日益成为改善用户体验和确保数据安全的新型计算方案。本文提出了一种针对多模态3D目标检测中特征压缩问题的 pioneering 解决方案。针对边缘设备上的稀疏张量基础目标检测网络,我们引入两种模式以满足不同的应用需求:传输友好型特征压缩 (Transmission-Friendly Feature Compression, T-FFC) 和精度友好型特征压缩 (Accuracy-Friendly Feature Compression, A-FFC)。在 T-FFC 模式下,仅传输网络背部最后一层的输出特征。接收到的特征在云端设备上通过通道扩展模块和两个空间上采样模块来生成多尺度特征。在 A-FFC 模式下,基于 T-FFC,在传输两种额外类型的特征后,云端设备能够生成更精确的多尺度特征。在使用 VirConv-L 检测网络对 KITTI 数据集进行实验后,结果显示 T-FFC 能够以约 6061 倍的压缩比率进行特征压缩,检测性能下降不到 3%。另一方面,A-FFC 能够实现约 901 倍的特征压缩,几乎没有检测性能下降。我们还设计了可选的残差提取和3D目标重建模块,以促进检测目标的重建。重建的目标有效地反映了原始对象的细节。
引用
@article{arxiv.2409.04123,
title = {Feature Compression for Cloud-Edge Multimodal 3D Object Detection},
author = {Chongzhen Tian and Zhengxin Li and Hui Yuan and Raouf Hamzaoui and Liquan Shen and Sam Kwong},
journal= {arXiv preprint arXiv:2409.04123},
year = {2024}
}