通过想象成功进行视觉导航学习
计算机视觉与模式识别
2021-03-02 v1
摘要
视觉导航通常被构建为强化学习(RL)问题。当前方法通常得到学习通用避障与搜索行为的次优策略。例如,在目标物体导航设定中,传统方法学到的策略往往无法完成任务,即使从人类视角看目标明显在可及范围内。为解决此问题,我们提出学习想象成功(子)目标状态的潜在表征。为此,我们开发了一个称为前瞻想象(ForeSIT)的模块。ForeSIT 被训练为想象导致成功的未来状态的循环潜在表征,例如到达目标前的重要子目标状态,或目标状态本身。通过在训练中以使策略以所生成想象为条件,我们的智能体学会如何利用该想象稳健地实现其目标。我们的智能体能够想象(子)目标状态可能呈现的样子(在潜在空间中),并学会朝该状态导航。我们开发了一种高效学习算法以在线策略方式训练 ForeSIT 并将其整合进我们的 RL 目标。由于想象与策略间共享的不断演进的状态表征,该整合并非易事。我们通过实验观察到,在广泛接受的基准 AI2THOR 环境中,我们的方法大幅优于最先进方法。我们的方法可轻易集成或添加至其他无模型 RL 导航框架。
引用
@article{arxiv.2103.00446,
title = {Learning for Visual Navigation by Imagining the Success},
author = {Mahdi Kazemi Moghaddam and Ehsan Abbasnejad and Qi Wu and Javen Shi and Anton Van Den Hengel},
journal= {arXiv preprint arXiv:2103.00446},
year = {2021}
}