用于视觉导航的物体关系图与试探策略学习
计算机视觉与模式识别
2020-07-23 v1
摘要
目标驱动的视觉导航旨在基于智能体的观测将其导航至给定目标。在该任务中,学习信息丰富的视觉表征与鲁棒的导航策略至关重要。为改进这两个组件,本文提出三种互补技术:物体关系图(ORG)、试错驱动模仿学习(IL)和记忆增强的试探策略网络(TPN)。ORG 通过整合物体关系(包括类别相近性与空间关联,例如电视通常在空间上与遥控器共现)来改进视觉表征学习。试错驱动 IL 与 TPN 均支撑鲁棒导航策略,指导智能体脱离死锁状态,如循环或卡住。具体而言,试错驱动 IL 是策略网络训练中使用的一种监督,而 TPN 在测试时模拟未知环境中的 IL 监督。在人工环境 AI2-Thor 中的实验验证了每种技术的有效性。组合使用时,这些技术在未知环境的导航效果与效率上相较基线方法带来显著提升。我们报告成功率与按路径长度加权的成功率(SPL)分别提升 22.8% 和 23.5%。代码见 https://github.com/xiaobaishu0097/ECCV-VN.git。
引用
@article{arxiv.2007.11018,
title = {Learning Object Relation Graph and Tentative Policy for Visual Navigation},
author = {Heming Du and Xin Yu and Liang Zheng},
journal= {arXiv preprint arXiv:2007.11018},
year = {2020}
}