基于强化学习的信息化路径规划策略自适应选择
机器人学
2021-08-17 v1 人工智能
机器学习
摘要
在我们之前的工作中,我们设计了一种系统性策略,利用高斯过程回归(GPR)的预测不确定性作为路径规划中部署机器人的“吸引力”,对采样位置进行优先级排序,从而显著提高了空间插值的精度。尽管与旅行商问题(TSP)求解器的结合也被证明能产生较短的行驶距离,我们在此假设若干因素也可能降低整体预测精度,因为次优位置最终可能被纳入其路径中。为解决该问题,本文首先探索“局部规划”方法,采用不同的空间范围对下一采样位置进行优先级排序,以研究其对预测性能及所产生的行驶距离的影响。此外,我们训练了基于强化学习(RL)的高层控制器,以自适应地从一组特定局部规划器中生成混合规划,从而根据最新预测状态继承该选择各自的独特优势。我们在温度监测机器人用例上的实验表明,规划器的动态混合不仅能生成单一规划器无法生成的复杂、信息化规划,还能在无需额外最短路径计算模块辅助的情况下,以不牺牲预测可靠性为代价显著减少行驶距离。
引用
@article{arxiv.2108.06618,
title = {Adaptive Selection of Informative Path Planning Strategies via Reinforcement Learning},
author = {Taeyeong Choi and Grzegorz Cielniak},
journal= {arXiv preprint arXiv:2108.06618},
year = {2021}
}
备注
Published in the proceedings of ECMR 2021