活在当下:适应演化策略的动力学模型学习
机器学习
2023-06-27 v4
摘要
基于模型的强化学习(RL)通常通过学习的动力学模型生成样本用于策略学习,在实践中比无模型RL获得更高的样本效率。先前的工作学习一个在所有历史策略(即样本回放缓冲区)的经验状态-动作访问分布下拟合的动力学模型。然而,在本文中,我们观察到在所有历史策略的分布下拟合动力学模型不一定有利于对当前策略的模型预测,因为所使用的策略随时间不断演化。训练期间演化的策略将导致状态-动作访问分布偏移。我们从理论上分析了这种历史策略上的分布偏移如何影响模型学习和模型展开。然后我们提出了一种新颖的动力学模型学习方法,名为策略适应动力学模型学习(Policy-adapted Dynamics Model Learning, PDML)。PDML动态调整历史策略混合分布,以确保学习的模型能够持续适应演化策略的状态-动作访问分布。在MuJoCo中一系列连续控制环境上的实验表明,PDML结合最先进的基于模型的RL方法,在样本效率和渐近性能上均取得了显著提升。
引用
@article{arxiv.2207.12141,
title = {Live in the Moment: Learning Dynamics Model Adapted to Evolving Policy},
author = {Xiyao Wang and Wichayaporn Wongkamjan and Furong Huang},
journal= {arXiv preprint arXiv:2207.12141},
year = {2023}
}
备注
16 pages, 5 figures