中文

用于主动视觉探索的副手策略学习

计算机视觉与模式识别 2018-07-31 v1

摘要

我们考虑一种主动视觉探索场景,其中智能体必须智能地选择其相机运动,以仅从一组有限的窄视场 glimpses 高效重建完整环境。虽然在训练期间智能体对环境具有完全可观测性,但一旦部署则仅有部分可观测性,受限于其已看到的部分以及允许的相机运动。我们引入副手策略学习(sidekick policy learning)以利用这种可观测性的不平衡。主要思想是一个准备性学习阶段,尝试简化版本的最终探索任务,然后通过奖励塑形或初始策略监督来引导智能体。为支持对所得策略的解释,我们还开发了一种新颖的策略可视化技术。在包含360个场景和3D物体的主动视觉探索任务上的结果表明,副手策略在性能和收敛速率上始终优于现有方法。代码、数据和演示可用。

关键词

引用

@article{arxiv.1807.11010,
  title  = {Sidekick Policy Learning for Active Visual Exploration},
  author = {Santhosh K. Ramakrishnan and Kristen Grauman},
  journal= {arXiv preprint arXiv:1807.11010},
  year   = {2018}
}

备注

26 pages, 13 figures, to appear in ECCV 2018