Anyview:基于可变帧的泛化室内 3D 目标检测
计算机视觉与模式识别
2025-07-03 v2 机器人学
摘要
在本文中,我们提出一种新颖的室内 3D 目标检测网络框架,以处理实际场景中的可变输入帧数。现有方法仅考虑单个检测器固定帧的输入数据,例如单目 RGB-D 图像或从密集多视角 RGB-D 图像重建的点云。而在机器人导航与操控等实际应用场景中,3D 检测器的原始输入是具有可变帧数的 RGB-D 图像,而非重建的场景点云。然而,先前的方法只能处理固定帧输入数据,且在可变帧输入下性能较差。为促进适用于实际任务的 3D 目标检测方法,我们提出一种名为 AnyView 的新颖 3D 检测框架以用于实际应用,其通过单一模型在不同输入帧数下均具有良好泛化性。具体而言,我们提出一种几何学习器来挖掘每帧输入 RGB-D 图像的局部几何特征,并通过设计的空间混合模块实现局部-全局特征交互。同时,我们进一步利用动态 token 策略自适应调整每帧提取的特征数量,从而保证一致的全局特征密度并进一步增强融合后的泛化性。在 ScanNet 数据集上的大量实验表明,我们的方法以简洁干净的架构(参数量与基线相近)实现了出色的泛化性与高检测精度。
引用
@article{arxiv.2310.05346,
title = {Anyview: Generalizable Indoor 3D Object Detection with Variable Frames},
author = {Zhenyu Wu and Xiuwei Xu and Ziwei Wang and Chong Xia and Linqing Zhao and Jiwen Lu and Haibin Yan},
journal= {arXiv preprint arXiv:2310.05346},
year = {2025}
}
备注
11 pages, 7 figures