中文

面向高效元强化学习的上下文感知任务推理学习

机器学习 2022-05-03 v2 人工智能 机器学习

摘要

尽管基于深度网络的强化学习(RL)近期取得了成功,但在学习新任务时达到人类水平的效率仍难以实现。先前的努力试图使用元学习策略应对这一挑战,但它们通常受限于同策略 RL 算法的采样低效或离策略学习的元过拟合。在本工作中,我们提出一种新颖的元 RL 策略以解决这些局限。具体而言,我们将元 RL 问题分解为三个子任务:任务探索、任务推断与任务执行,并由两个深度网络智能体与一个任务编码器实例化。在元训练期间,我们的方法学习一个用于任务执行的任务条件化 actor 网络、一个带有自监督奖励塑形以在任务探索中鼓励任务信息性经验的探索者网络,以及一个用于任务推断的上下文感知基于图的任务编码器。我们在多个公开基准上通过大量实验验证了我们的方法,结果表明我们的算法有效地执行用于任务推断的探索,在训练与测试期间均提升了采样效率,并缓解了元过拟合问题。

关键词

引用

@article{arxiv.2003.01373,
  title  = {Learning Context-aware Task Reasoning for Efficient Meta-reinforcement Learning},
  author = {Haozhe Wang and Jiale Zhou and Xuming He},
  journal= {arXiv preprint arXiv:2003.01373},
  year   = {2022}
}

备注

accepted by AAMAS2020