3D Semantic MapNet:构建用于 3D 多目标重识别的地图
计算机视觉与模式识别
2024-03-21 v1
摘要
我们研究了从具身巡游中进行 3D 多目标重识别的任务。具体而言,一个智能体被给予在两种不同布局(例如家具布置)下对同一环境(例如公寓)的两次巡游。它的任务是在 3D 中检测并重识别物体——例如从位置 A 移动到 B 的“沙发”,在第二种布局中位置 C 处的一把新“椅子”,或者第一种布局中位置 D 处的“灯”在第二种布局中缺失。为了支持这项任务,我们创建了一个自动化基础设施,使用 Matterport3D 场景、YCB 和 Google 扫描物体在 Habitat 模拟器中生成初始/修改布局的成对自我中心巡游。我们提出了 3D Semantic MapNet (3D-SMNet)——一个两阶段重识别模型,由 (1) 一个在已知姿态的 RGB-D 视频上运行的 3D 物体检测器,和 (2) 一个可微物体匹配模块组成,该模块求解两组 3D 边界框之间的对应估计。总体而言,3D-SMNet 构建每个布局的基于物体的地图,然后使用可微匹配器在巡游之间重识别物体。在我们生成的片段上训练 3D-SMNet 后,我们通过在描绘重排场景的 Replica、Active Vision 和 RIO 环境中实例化我们的任务,展示了对真实世界重排场景的零样本迁移。在所有数据集上,我们发现 3D-SMNet 优于具有竞争力的基线。此外,我们表明在真实和生成片段上联合训练可以带来比仅在真实数据上训练更显著的改进。
引用
@article{arxiv.2403.13190,
title = {3D Semantic MapNet: Building Maps for Multi-Object Re-Identification in 3D},
author = {Vincent Cartillier and Neha Jain and Irfan Essa},
journal= {arXiv preprint arXiv:2403.13190},
year = {2024}
}
备注
8pages