3D-SPS:通过所指点渐进选择实现单阶段三维视觉定位
计算机视觉与模式识别
2023-10-13 v1
摘要
三维视觉定位旨在根据自由形式的语言描述在三维点云场景中定位所指目标物体。先前方法大多遵循两阶段范式,即语言无关的检测与跨模态匹配,受限于孤立的架构。在此范式中,由于三维点云的内在属性(不规则且大规模),检测器需要从原始点云中采样关键点,以为每个关键点生成相应的物体提议。然而,稀疏提议可能在检测中遗漏目标,而密集提议可能混淆匹配模型。此外,语言无关的检测阶段只能采样目标上很小比例的关键点,恶化了目标预测。本文中,我们提出一种三维单阶段所指点渐进选择(3D-SPS)方法,其在语言引导下渐进选择关键点并直接定位目标。具体而言,我们提出描述感知关键点采样(DKS)模块以粗略聚焦于语言相关物体的点,这些点是定位的重要线索。此外,我们设计面向目标的渐进挖掘(TPM)模块以精细集中于目标的点,其通过渐进式模态内关系建模与模态间目标挖掘实现。3D-SPS弥合了三维视觉定位任务中检测与匹配的鸿沟,在单阶段定位目标。实验表明3D-SPS在ScanRefer和Nr3D/Sr3D数据集上均达到最先进的性能。
引用
@article{arxiv.2204.06272,
title = {3D-SPS: Single-Stage 3D Visual Grounding via Referred Point Progressive Selection},
author = {Junyu Luo and Jiahui Fu and Xianghao Kong and Chen Gao and Haibing Ren and Hao Shen and Huaxia Xia and Si Liu},
journal= {arXiv preprint arXiv:2204.06272},
year = {2023}
}
备注
CVPR 2022, Oral