IS-Fusion:面向多模态三维目标检测的实例-场景协同融合
计算机视觉与模式识别
2024-03-25 v1
摘要
鸟瞰图(BEV)表示已成为自动驾驶场景中描述三维空间的主流方案。然而,BEV表示中的目标通常尺寸较小,且关联的点云上下文本质稀疏,这给可靠的三维感知带来了巨大挑战。本文提出IS-Fusion,一种创新性的多模态融合框架,能够联合捕获实例级和场景级上下文信息。IS-Fusion与现有仅关注BEV场景级融合的方法有本质区别,它显式地融入了实例级多模态信息,从而有利于三维目标检测等以实例为中心的任务。该框架包含一个层次化场景融合(HSF)模块和一个实例引导融合(IGF)模块。HSF应用点到网格(Point-to-Grid)和网格到区域(Grid-to-Region)变换器来捕获不同粒度的多模态场景上下文。IGF挖掘实例候选,探索它们之间的关系,并为每个实例聚合局部多模态上下文。这些实例随后作为引导来增强场景特征,并产生实例感知的BEV表示。在具有挑战性的nuScenes基准上,IS-Fusion优于迄今为止所有已发表的多模态工作。代码见:https://github.com/yinjunbo/IS-Fusion。
引用
@article{arxiv.2403.15241,
title = {IS-Fusion: Instance-Scene Collaborative Fusion for Multimodal 3D Object Detection},
author = {Junbo Yin and Jianbing Shen and Runnan Chen and Wei Li and Ruigang Yang and Pascal Frossard and Wenguan Wang},
journal= {arXiv preprint arXiv:2403.15241},
year = {2024}
}
备注
Accepted to CVPR 2024; Code: https://github.com/yinjunbo/IS-Fusion