用于离线策略评估与优化的自回归动力学模型
机器学习
2021-04-29 v1 人工智能
机器学习
摘要
用于连续控制的标准动力学模型利用前馈计算,通过具有对角协方差结构的多元高斯分布,在给定当前状态与动作的条件下预测下一状态与奖励的条件分布。这种建模选择假设下一状态与奖励的不同维度在给定当前状态与动作时条件独立,其可能源于完全可观测的基于物理的仿真环境具有确定性转移动力学这一事实。本文中,我们质疑该条件独立假设,并提出一类更具表达力的自回归动力学模型,其按顺序生成下一状态与奖励的不同维度,并以先前维度为条件。我们证明自回归动力学模型在保留转移数据上的对数似然方面确实优于标准前馈模型。此外,我们在 RL Unplugged(一套离线 MuJoCo 数据集)上比较了不同的基于模型与无模型的离线策略评估(OPE)方法,发现自回归动力学模型一致优于所有基线,达到了新的最先进水平。最后,我们展示自回归动力学模型可用于离线策略优化,作为通过数据增强丰富经验回放池并借助基于模型的规划提升性能的手段。
引用
@article{arxiv.2104.13877,
title = {Autoregressive Dynamics Models for Offline Policy Evaluation and Optimization},
author = {Michael R. Zhang and Tom Le Paine and Ofir Nachum and Cosmin Paduraru and George Tucker and Ziyu Wang and Mohammad Norouzi},
journal= {arXiv preprint arXiv:2104.13877},
year = {2021}
}
备注
ICLR 2021. 17 pages