Semantic MapNet:从以自我为中心的视角构建 allocentric 语义地图与表示
计算机视觉与模式识别
2021-03-12 v3
摘要
我们研究语义建图任务——具体而言,一个具身智能体(机器人或以自我为中心的 AI 助手)被带领参观一个新环境,并要求根据具有已知位姿(通过定位传感器)的 RGB-D 相机的以自我为中心的观测,构建一个 allocentric 的俯视语义地图(“什么在哪里?”)。针对这一目标,我们提出 SemanticMapNet(SMNet),其包含:(1)对每个以自我为中心的 RGB-D 帧进行编码的以自我为中心视觉编码器,(2)将以自我为中心的特特征投影到平面图适当位置的特征投影器,(3)大小为 平面图长 x 宽 x 特征维数、学习累积投影的以自我为中心特征的空间记忆张量,以及(4)利用记忆张量生成语义俯视地图的地图解码器。SMNet 结合了(已知的)投影相机几何与神经表示学习的优势。在 Matterport3D 数据集上的语义建图任务中,SMNet 在 mean-IoU 上以 4.01-16.81%(绝对)和在 Boundary-F1 指标上以 3.81-19.69%(绝对)显著优于竞争基线。此外,我们展示了如何利用 SMNet 构建的神经情景记忆和空间-语义 allocentric 表示来完成同一空间中的后续任务——导航到参观期间看到的物体(“找椅子”)或回答关于该空间的问题(“你在房子里看到了多少把椅子?”)。项目页面:https://vincentcartillier.github.io/smnet.html。
引用
@article{arxiv.2010.01191,
title = {Semantic MapNet: Building Allocentric Semantic Maps and Representations from Egocentric Views},
author = {Vincent Cartillier and Zhile Ren and Neha Jain and Stefan Lee and Irfan Essa and Dhruv Batra},
journal= {arXiv preprint arXiv:2010.01191},
year = {2021}
}