PLGRIM:面向未知环境大规模探索的分层价值学习
机器人学
2021-07-22 v2
摘要
为了使自主机器人能够高效探索未知环境,它必须考虑传感器测量、危险评估、定位和运动执行中的不确定性。在随机环境中为最大化奖励进行决策,需要在信念空间(即所有机器人-世界状态可能性的概率分布)上进行价值学习与策略构建。然而,在大型空间环境中、长时域下的信念空间规划面临严峻的计算挑战。此外,构建的策略必须在运行时安全地适应信念中的意外变化。本工作提出了一个可扩展的价值学习框架 PLGRIM(Probabilistic Local and Global Reasoning on Information roadMaps,基于信息路线图的概率局部与全局推理),弥合了(i)局部、风险感知的弹性与(ii)全局、追求奖励的任务目标之间的差距。借助具有信息丰富图结构的分层信念空间规划器,PLGRIM 在提供局部近最优覆盖规划的同时解决了大规模探索问题。我们在多种环境中的高保真动态仿真以及火星类比熔岩管中的实体机器人上验证了所提出的框架。
引用
@article{arxiv.2102.05633,
title = {PLGRIM: Hierarchical Value Learning for Large-scale Exploration in Unknown Environments},
author = {Sung-Kyun Kim and Amanda Bouman and Gautam Salhotra and David D. Fan and Kyohei Otsu and Joel Burdick and Ali-akbar Agha-mohammadi},
journal= {arXiv preprint arXiv:2102.05633},
year = {2021}
}