中文

AdaRL:迁移强化学习中什么、何处及如何适应

机器学习 2022-03-16 v4 人工智能 机器学习

摘要

强化学习(RL)中的一个实际挑战是面对新环境时如何快速适应。本文提出一种称为 \textit{AdaRL} 的适应性 RL 原则性框架,该框架可靠且高效地将策略适应于跨域变化,仅需来自目标域的少量样本,即便在部分可观测环境中亦如此。具体而言,我们利用一种简约图表示来刻画 RL 系统中变量间的结构关系。此类图表示为编码跨域变化的内容与位置提供了紧凑方式,并进一步告知我们为策略适应目的必须考虑的最小变化集合。我们展示通过显式利用该紧凑表示来编码变化,可高效将策略适应至目标域,其中仅需少量样本且避免了进一步的策略优化。我们通过一系列改变 Cartpole 与 Atari 游戏中观测、转移与奖励函数因素的实验阐明了 AdaRL 的有效性。

关键词

引用

@article{arxiv.2107.02729,
  title  = {AdaRL: What, Where, and How to Adapt in Transfer Reinforcement Learning},
  author = {Biwei Huang and Fan Feng and Chaochao Lu and Sara Magliacane and Kun Zhang},
  journal= {arXiv preprint arXiv:2107.02729},
  year   = {2022}
}