三维点云视觉定位的统一框架
计算机视觉与模式识别
2023-11-21 v2
摘要
得益于其精确的空间指代,三维点云视觉定位对于三维环境中的深度理解与动态交互至关重要,涵盖三维指代表达理解 (3DREC) 与分割 (3DRES)。我们认为 3DREC 与 3DRES 应统一于一个框架中,这也是该领域的自然进展。究其原因,3DREC 帮助 3DRES 定位指代对象,而 3DRES 也通过更细粒度的语言-视觉对齐促进 3DREC。为此,本文主动将 3DREC 与 3DRES 集成至统一框架,称为三维指代 Transformer (3DRefTR)。其关键思想是基于成熟的 3DREC 模型,并利用该模型已有的查询嵌入与视觉令牌构建专用掩码分支。具体而言,我们提出超点掩码分支,其具有双重目的:i) 借助超点与点点云间的内在关联,免去在高分辨率视觉特征上采样的沉重计算开销;ii) 利用异构 CPU-GPU 并行,在 GPU 忙于生成视觉与语言令牌时,CPU 并行生成超点,等效完成上采样计算。这一精巧设计使 3DRefTR 仅以相较原 3DREC 模型 6% 的额外延迟,即具备优异的 3DRES 与 3DREC 能力。实证评测肯定了 3DRefTR 的优越性。具体地,在 ScanRefer 数据集上,3DRefTR 的 mIoU 超越 SOTA 3DRES 方法 12.43%,并在 [email protected] 上较 SOTA 3DREC 方法提升 0.6%。代码与模型将很快发布。
引用
@article{arxiv.2308.11887,
title = {A Unified Framework for 3D Point Cloud Visual Grounding},
author = {Haojia Lin and Yongdong Luo and Xiawu Zheng and Lijiang Li and Fei Chao and Taisong Jin and Donghao Luo and Yan Wang and Liujuan Cao and Rongrong Ji},
journal= {arXiv preprint arXiv:2308.11887},
year = {2023}
}