中文

APPLE:基于评价性反馈的自适应规划器参数学习

机器人学 2021-08-24 v1

摘要

经典自主导航系统能以无碰撞方式控制机器人,且通常具有可验证的安全性和可解释性。然而,面对新环境时,通常需要在系统按预期导航前由专家对系统参数进行微调。为缓解这一需求,近期提出的自适应规划器参数学习范式允许机器人使用遥操作演示或非专家用户的纠正性干预来\emph{学习}如何动态调整规划器参数。但这些交互方式要求用户完全控制运动中的机器人,需要用户熟悉机器人遥操作。作为替代,我们引入 \textsc{apple},即基于\emph{评价性反馈}(对行为的实时标量值评估)的自适应规划器参数学习,其代表一种要求更低的交互方式。仿真与实物实验表明,\textsc{apple} 相比采用静态默认参数的规划器能取得更好性能,甚至相较来自更丰富交互方式的学习参数也有提升。

关键词

引用

@article{arxiv.2108.09801,
  title  = {APPLE: Adaptive Planner Parameter Learning from Evaluative Feedback},
  author = {Zizhao Wang and Xuesu Xiao and Garrett Warnell and Peter Stone},
  journal= {arXiv preprint arXiv:2108.09801},
  year   = {2021}
}

备注

6 pages, 4 figures, accepted in IROS 2021. arXiv admin note: substantial text overlap with arXiv:2105.07620