基于子目标抽象在部分地图中导航的数据高效策略选择
机器人学
2024-01-10 v2
摘要
我们提出一种用于部分地图中导航的快速可靠策略选择新方法。利用近期提出的、基于学习的模型式“基于子目标规划的学习(LSP)”抽象进行规划,我们的机器人复用在导航过程中收集的数据,通过我们称为离线替代策略重放的过程评估其他备选策略本可取得的性能。来自离线替代策略重放的开销约束了部署期间基于LSP的策略间的策略选择,从而在收敛速度、累积后悔与平均导航代价上带来改善。仅在对未知环境性质有有限先验知识的情况下,我们在模拟迷宫与类办公室环境的实验中,相较基线bandit方法于累积后悔上取得了至少67%、至多96%的提升。
引用
@article{arxiv.2304.01094,
title = {Data-Efficient Policy Selection for Navigation in Partial Maps via Subgoal-Based Abstraction},
author = {Abhishek Paudel and Gregory J. Stein},
journal= {arXiv preprint arXiv:2304.01094},
year = {2024}
}
备注
8 pages, 5 figures. Accepted at IROS 2023