中文

面向视觉导航的视觉表征情境融合

计算机视觉与模式识别 2021-08-05 v2

摘要

复杂的视觉导航任务使智能体处于不同情境中,需要多样化的视觉感知能力。例如,要“走到最近的椅子”,智能体可能需要利用语义在客厅中识别椅子、利用消失点线索沿走廊前行,以及利用深度避开障碍物。因此,基于对视觉环境的情境理解来利用适当的视觉感知能力,可增强这些导航模型在未见视觉环境中的表现。我们提出训练一个智能体来融合对应于多样视觉感知能力的一大组视觉表征。为充分利用每种表征,我们开发了动作级表征融合方案,该方案从每种表征预测一个动作候选,并自适应地将这些动作候选整合为最终动作。此外,我们采用数据驱动的跨任务亲和正则化以减少冗余并提升泛化能力。我们的方法在 novel 环境中相较 ImageNet 预训练基线及其他融合方法取得了显著改进的性能。

关键词

引用

@article{arxiv.1908.09073,
  title  = {Situational Fusion of Visual Representation for Visual Navigation},
  author = {Bokui Shen and Danfei Xu and Yuke Zhu and Leonidas J. Guibas and Li Fei-Fei and Silvio Savarese},
  journal= {arXiv preprint arXiv:1908.09073},
  year   = {2021}
}