基于策略-动力学值函数的快速适应
机器学习
2020-07-07 v1 人工智能
摘要
标准强化学习(RL)算法假设环境动力学固定,并需要大量交互来适应新环境。我们提出策略-动力学值函数(PD-VF),一种用于快速适应训练中所见动力学之外的新动力学的全新方法。PD-VF 在策略与环境空间中显式估计累积奖励。使用一组常规 RL 策略在训练环境中收集经验,从中可学习策略与环境的嵌入表示。随后训练一个以两种嵌入为条件的值函数。在测试时,少量动作便足以推断环境嵌入,从而通过最大化所学值函数(无需额外环境交互)来选定策略。我们展示了该方法能在一组 MuJoCo 域上快速适应新动力学。代码见 https://github.com/rraileanu/policy-dynamics-value-functions。
引用
@article{arxiv.2007.02879,
title = {Fast Adaptation via Policy-Dynamics Value Functions},
author = {Roberta Raileanu and Max Goldstein and Arthur Szlam and Rob Fergus},
journal= {arXiv preprint arXiv:2007.02879},
year = {2020}
}