中文

NoRML:无奖励元学习

机器学习 2019-03-05 v1 人工智能 机器人学 机器学习

摘要

高效适应新环境和动力学变化对于智能体在现实世界中成功运行至关重要。基于强化学习 (RL) 的方法通常依赖外部奖励反馈进行适应。然而,在许多场景中,目标任务的奖励信号可能不易获取,或者环境之间的差异可能是隐式的,只能从动力学中观察到。为此,我们引入了一种允许学习策略自适应的方法:无奖励元学习 (NoRML)。NoRML 扩展了用于 RL 的模型不可知元学习 (MAML),并在 MAML 的微调步骤中使用环境的可观测动力学代替显式奖励函数。我们的方法具有比 MAML 更具表达力的更新步骤,同时保持了 MAML 基于梯度的基础。此外,为了实现更有针对性的探索,我们实现了对 MAML 的扩展,有效地将元策略参数与微调策略的参数断开。我们首先在若干合成控制问题上研究我们的方法,然后在常见基准环境中验证我们的方法,表明当任务间动力学发生变化时,NoRML 优于 MAML。

关键词

引用

@article{arxiv.1903.01063,
  title  = {NoRML: No-Reward Meta Learning},
  author = {Yuxiang Yang and Ken Caluwaerts and Atil Iscen and Jie Tan and Chelsea Finn},
  journal= {arXiv preprint arXiv:1903.01063},
  year   = {2019}
}