中文

基于点云感知的照片级真实环境中的具身问答

计算机视觉与模式识别 2019-04-09 v1 人工智能 计算与语言 机器学习

摘要

为助力缩小互联网视觉风格问题与具身感知视觉目标之间的差距,我们实例化了一项大规模导航任务——在照片级真实环境(Matterport 3D)中的具身问答 [1]。我们深入研究了利用 3D 点云、RGB 图像或其组合的导航策略。对这些模型的分析揭示了若干关键发现。我们发现,由于 [1] 所提出的特定评估设置选择,两种看似朴素的导航基线(仅前进与随机)是强大的导航器且难以被超越。我们发现了一种称为拐点加权(Inflection Weighting)的新颖损失加权方案,在通过行为克隆训练循环神经网络导航模型时至关重要,并能够借助该技术超越基线。我们发现,相较于 RGB 图像,点云为学习避障提供了更丰富的信号,这推动了(并值得持续研究)用于具身导航的 3D 深度学习模型的应用。

关键词

引用

@article{arxiv.1904.03461,
  title  = {Embodied Question Answering in Photorealistic Environments with Point Cloud Perception},
  author = {Erik Wijmans and Samyak Datta and Oleksandr Maksymets and Abhishek Das and Georgia Gkioxari and Stefan Lee and Irfan Essa and Devi Parikh and Dhruv Batra},
  journal= {arXiv preprint arXiv:1904.03461},
  year   = {2019}
}