3D 场景中的稠密物体定位
计算机视觉与模式识别
2023-09-06 v1 人工智能
摘要
根据给定自然语言的语义在 3D 场景中定位物体是多媒体理解领域一项基础而重要的任务,其有益于机器人与自动驾驶等多种现实应用。然而,现有大多数 3D 物体定位方法局限于描述单个物体的单句输入,无法理解并推理更实际 3D 案例中多个物体的更具上下文的描述。为此,我们引入一项新挑战性任务,称为 3D 稠密物体定位(3D DOG),以联合定位一段较复杂段落(而非单句)中描述的多个物体。我们并非朴素地独立定位每个句子引导的物体,而是发现同一段落中描述的稠密物体常在语义上相关且在 3D 场景的聚焦区域中空间相邻。为利用被密集指代物体的此类语义与空间关系以实现更准确定位,我们提出一种基于堆叠 Transformer 的 3D DOG 框架,名为 3DOGSFormer。具体而言,我们首先设计上下文查询驱动的局部 transformer 解码器,为每个目标物体生成初始定位提议;随后采用提议引导的全局 transformer 解码器,利用局部物体特征学习其关联性以进一步精炼初始定位提议。在三个挑战性基准(Nr3D、Sr3D 和 ScanRefer)上的大量实验表明,我们提出的 3DOGSFormer 以显著优势优于 SOTA 的 3D 单物体定位方法及其稠密物体变体。
引用
@article{arxiv.2309.02224,
title = {Dense Object Grounding in 3D Scenes},
author = {Wencan Huang and Daizong Liu and Wei Hu},
journal= {arXiv preprint arXiv:2309.02224},
year = {2023}
}
备注
ACM MM 2023