中文

面向稀疏奖励数据高效学习的多目标基于模型的策略搜索

机器学习 2020-03-05 v3 人工智能 神经与进化计算 机器人学 机器学习

摘要

机器人学中最具数据效率的强化学习算法是基于模型的策略搜索算法,它们在学习的机器人动力学模型与给定模型及其不确定性下交替进行策略优化以最大化期望回报。然而,现有算法缺乏有效的探索策略来处理稀疏或误导性奖励场景:若在初始随机探索期间未经历任何具有正奖励的状态,则极不可能解决问题。在此,我们提出一种新颖的基于模型的策略搜索算法Multi-DEX,其利用学习的动力学模型高效探索任务空间并在少量回合内解决稀疏奖励任务。为此,我们将策略搜索问题构建为具有三个目标的多目标基于模型的策略优化问题:(1)生成最大新颖性的状态轨迹,(2)最大化期望回报,(3)使系统保持在模型尽可能准确的状态空间区域。随后我们使用基于帕累托的多目标优化算法优化这些目标。实验表明,Multi-DEX能够以远低于VIME、TRPO、GEP-PG、CMA-ES和Black-DROPS的交互时间解决稀疏奖励场景(使用模拟机械臂)。

关键词

引用

@article{arxiv.1806.09351,
  title  = {Multi-objective Model-based Policy Search for Data-efficient Learning with Sparse Rewards},
  author = {Rituraj Kaushik and Konstantinos Chatzilygeroudis and Jean-Baptiste Mouret},
  journal= {arXiv preprint arXiv:1806.09351},
  year   = {2020}
}

备注

Conference on Robot Learning (CoRL)- 2018; Code at https://github.com/resibots/kaushik_2018_multi-dex ; Video at https://youtu.be/9ZLwUxAAq6M