中文

仅需监督学习:从模仿学习到基于倒置强化学习的元强化学习

机器学习 2022-02-25 v1 人工智能

摘要

倒置强化学习(UDRL)将强化学习中目标函数里回报的传统用法上下颠倒,把回报作为输入并预测动作。UDRL 纯粹基于监督学习,绕过了 RL 中若干突出问题:自举、离策略校正与折扣因子。先前 UDRL 的工作在传统在线 RL 设定中展示,而此处我们表明这一单一算法也可用于模仿学习与离线 RL 设定,可扩展至目标条件 RL 设定,甚至元 RL 设定。借助通用智能体架构,单个 UDRL 智能体可跨所有范式学习。

关键词

引用

@article{arxiv.2202.11960,
  title  = {All You Need Is Supervised Learning: From Imitation Learning to Meta-RL With Upside Down RL},
  author = {Kai Arulkumaran and Dylan R. Ashley and Jürgen Schmidhuber and Rupesh K. Srivastava},
  journal= {arXiv preprint arXiv:2202.11960},
  year   = {2022}
}