中文

Trans4Map:利用视觉 Transformer 重新审视从自我中心图像到异我中心语义的的整体式鸟瞰图映射

计算机视觉与模式识别 2022-10-17 v2 机器人学

摘要

人类具有感知周围环境的先天能力,因为他们可以从自我中心感知中提取空间表征,并通过空间变换与记忆更新形成异我中心语义地图。然而,赋予移动智能体这样一种空间感知能力仍具挑战,原因在于两个困难:(1) 先前的卷积模型受限于局部感受野,因而难以在观测中捕捉整体长程依赖;(2) 成功所需的过高计算预算常导致映射流程被分割为多个阶段,使整个映射过程效率低下。为解决这些问题,我们提出一种用于映射的端到端单阶段基于 Transformer 的框架,称为 Trans4Map。我们的自我中心到异我中心映射过程包括三步:(1) 高效 transformer 从一批自我中心图像中提取上下文特征;(2) 所提出的双向异我中心记忆(BAM)模块将自我中心特征投影至异我中心记忆;(3) 地图解码器解析累积记忆并预测自上而下的语义分割地图。相比之下,Trans4Map 取得了最先进结果,在 Matterport3D 数据集上减少 67.2% 参数量,同时获得 +3.25% mIoU 与 +4.09% mBF1 的提升。代码见:https://github.com/jamycheung/Trans4Map。

关键词

引用

@article{arxiv.2207.06205,
  title  = {Trans4Map: Revisiting Holistic Bird's-Eye-View Mapping from Egocentric Images to Allocentric Semantics with Vision Transformers},
  author = {Chang Chen and Jiaming Zhang and Kailun Yang and Kunyu Peng and Rainer Stiefelhagen},
  journal= {arXiv preprint arXiv:2207.06205},
  year   = {2022}
}

备注

Accepted to WACV 2023. Code is publicly available at https://github.com/jamycheung/Trans4Map