中文

基于策略-动力学值函数的快速适应

机器学习 2020-07-07 v1 人工智能

摘要

标准强化学习(RL)算法假设环境动力学固定,并需要大量交互来适应新环境。我们提出策略-动力学值函数(PD-VF),一种用于快速适应训练中所见动力学之外的新动力学的全新方法。PD-VF 在策略与环境空间中显式估计累积奖励。使用一组常规 RL 策略在训练环境中收集经验,从中可学习策略与环境的嵌入表示。随后训练一个以两种嵌入为条件的值函数。在测试时,少量动作便足以推断环境嵌入,从而通过最大化所学值函数(无需额外环境交互)来选定策略。我们展示了该方法能在一组 MuJoCo 域上快速适应新动力学。代码见 https://github.com/rraileanu/policy-dynamics-value-functions。

关键词

引用

@article{arxiv.2007.02879,
  title  = {Fast Adaptation via Policy-Dynamics Value Functions},
  author = {Roberta Raileanu and Max Goldstein and Arthur Szlam and Rob Fergus},
  journal= {arXiv preprint arXiv:2007.02879},
  year   = {2020}
}