SaViD:Spectravista 美学视觉集成,用于在挑战性环境中实现稳健且精确的3D目标检测
图像与视频处理
2025-03-27 v1
摘要
激光雷达与摄像头传感器的融合已在自动驾驶中实现短程任务的精准检测方面显示出显著效果。然而,这种融合方法在处理长程检测场景时可能面临挑战,因为激光雷达数据稀疏而摄像头数据高分辨率之间存在差异。此外,传感器损坏会引入复杂性,影响鲁棒性,尽管该领域正越来越多地采用传感器融合。我们提出了SaViD,一个包含三阶段融合对齐机制的新框架,用于在自然损坏存在的情况下解决长程检测挑战。SaViD框架由三个关键组成部分构成:Global Memory Attention Network (GMAN),通过提供更深入的全局模式理解来增强图像特征提取;Attentional Sparse Memory Network (ASMN),增强激光雷达与图像特征的集成;以及KNNnectivity Graph Fusion (KGF),实现整个空间信息的融合。在Waymo开放数据集(WOD)上的L2难度下,SaViD实现了AP值提升9.87%,mAPH提升2.39%。针对14种自然传感器损坏进行了全面实验以展示其鲁棒性。综合实验表明,SaViD在考虑两种数据集的所有损坏情况时,相较于其他现有融合方法在RCE值上分别实现了31.43%和16.13%的鲁棒性提升。我们的代码可在\href{https://github.com/sanjay-810/SAVID}获取。
引用
@article{arxiv.2503.20614,
title = {SaViD: Spectravista Aesthetic Vision Integration for Robust and Discerning 3D Object Detection in Challenging Environments},
author = {Tanmoy Dam and Sanjay Bhargav Dharavath and Sameer Alam and Nimrod Lilith and Aniruddha Maiti and Supriyo Chakraborty and Mir Feroskhan},
journal= {arXiv preprint arXiv:2503.20614},
year = {2025}
}
备注
This paper has been accepted for ICRA 2025, and copyright will automatically transfer to IEEE upon its availability on the IEEE portal