BoxFusion:基于实时多视角盒子融合的无重建开放词汇3D目标检测
计算机视觉与模式识别
2025-08-26 v3
摘要
开放词汇3D目标检测因其在自动驾驶和具身人工智能中的关键应用而受到广泛关注。现有检测方法(无论是离线或在线)通常依赖稠密点云重建,这带来了巨大的计算开销和内存限制,阻碍了下游任务中实时部署。为此,我们提出一种面向内存高效和实时3D检测的全新无重建在线框架。具体而言,给定流式带姿态的RGB-D视频输入,我们利用Cubify Anything作为预训练视觉基础模型(VFM),通过边界框实现单视角3D目标检测,同时借助CLIP捕获检测目标的开放词汇语义。为将不同视角中检测到的边界框融合为统一边界框,我们采用关联模块处理多视角对应关系,并设计优化模块融合同一实例在多视角中预测的3D边界框。关联模块运用3D非极大值抑制(NMS)和边界框对应匹配模块,优化模块则基于粒子滤波的IoU引导高效随机优化技术,以最小化计算复杂度实现3D边界框在多视角下的一致性。在ScanNetV2和CA-1M数据集上的大量实验表明,我们的方法在在线方法中实现了最先进的性能。凭借这种全新的无重建3D目标检测范式,我们的方法在各种场景下展现出卓越的泛化能力,使其即使在超过1000平方米的环境中也能实现实时感知。
引用
@article{arxiv.2506.15610,
title = {BoxFusion: Reconstruction-Free Open-Vocabulary 3D Object Detection via Real-Time Multi-View Box Fusion},
author = {Yuqing Lan and Chenyang Zhu and Zhirui Gao and Jiazhao Zhang and Yihan Cao and Renjiao Yi and Yijie Wang and Kai Xu},
journal= {arXiv preprint arXiv:2506.15610},
year = {2025}
}
备注
Project page: https://lanlan96.github.io/BoxFusion/