中文

基于多目标贝叶斯优化的鲁棒无模型强化学习

机器人学 2019-10-30 v1 人工智能 机器学习

摘要

在强化学习(RL)中,自主智能体通过在与环境交互时最大化外生奖励信号来学习执行复杂任务。在真实世界应用中,测试条件可能与训练场景存在显著差异,因此训练期间单纯关注奖励最大化可能导致测试时结果不佳。在这些情况下,在学习策略时权衡性能与鲁棒性十分重要。尽管针对鲁棒、基于模型的 RL 已有若干结果,无模型情形尚未被广泛研究。本文将鲁棒无模型 RL 问题表述为多目标优化问题。为量化策略的鲁棒性,我们使用延迟裕度和增益裕度,这两个在控制理论中常见的鲁棒性指标。我们展示了在無模型设定下如何从这些指标从数据中估计。我们使用多目标贝叶斯优化(MOBO)来高效求解这一评估代价高昂的多目标优化问题。我们在仿真到真实以及纯硬件实验中展示了我们鲁棒表述在平衡 Furuta 摆方面的益处。

关键词

引用

@article{arxiv.1910.13399,
  title  = {Robust Model-free Reinforcement Learning with Multi-objective Bayesian Optimization},
  author = {Matteo Turchetta and Andreas Krause and Sebastian Trimpe},
  journal= {arXiv preprint arXiv:1910.13399},
  year   = {2019}
}

备注

Submitted to IEEE Conference on Robotics and Automation 2020 (ICRA)