利用深度确定性动力学梯度估计 Q(s,s')
机器学习
2020-08-27 v2 人工智能
机器学习
摘要
在本文中,我们引入了一种新形式的价值函数,它表达了从状态转移到相邻状态然后此后最优行动的有效性。为了推导最优策略,我们开发了一个前向动力学模型,该模型学习做出最大化此价值的下一状态预测。该公式将动作与价值解耦,同时仍进行离策略学习。我们强调了该方法在价值函数迁移、冗余动作空间内学习以及从次优或完全随机策略生成的状态观测中进行离策略学习方面的优势。代码和视频可在 http://sites.google.com/view/qss-paper 获取。
引用
@article{arxiv.2002.09505,
title = {Estimating Q(s,s') with Deep Deterministic Dynamics Gradients},
author = {Ashley D. Edwards and Himanshu Sahni and Rosanne Liu and Jane Hung and Ankit Jain and Rui Wang and Adrien Ecoffet and Thomas Miconi and Charles Isbell and Jason Yosinski},
journal= {arXiv preprint arXiv:2002.09505},
year = {2020}
}
备注
Accepted into ICML 2020