利用分布式Soft Actor Critic学习对象条件探索
机器人学
2020-07-31 v2
摘要
对象导航定义为在复杂未探索环境中导航至给定标签的对象。其一般形式给机器人学带来若干挑战:搜索对象的未知环境语义探索与底层控制。本工作中我们研究对象引导探索与底层控制,并提出端到端训练的导航策略,在未见过的、视觉复杂的真实住宅扫描上取得0.68成功率与0.58 SPL。我们提出一种离策略强化学习算法、分布式 Soft Actor Critic 的高可扩展实现,使系统能在8块GPU上24小时内利用98M经验步。我们的系统从机器人平台常用的高维观测栈中,在仿真里学习控制差速驱动移动底座。所学策略具备从真实环境中纯经验习得的对象引导探索行为与底层控制。
引用
@article{arxiv.2007.14545,
title = {Learning Object-conditioned Exploration using Distributed Soft Actor Critic},
author = {Ayzaan Wahid and Austin Stone and Kevin Chen and Brian Ichter and Alexander Toshev},
journal= {arXiv preprint arXiv:2007.14545},
year = {2020}
}