解耦动态与回报:基于未来预测的价值函数分解
机器学习
2019-05-28 v1 机器学习
摘要
价值函数对于无模型强化学习(RL)隐式获取策略或指导策略更新至关重要。价值估计严重依赖于环境动态的随机性和奖励信号的质量。本文从未来预测的角度提出对价值估计的两步理解,将价值函数分解为与奖励无关的未来动态部分和独立于策略的轨迹回报部分。我们进而从上述分解推导出一种实用的深度RL算法,该算法由卷积轨迹表示模型、用于预测未来轨迹期望表示的条件变分动态模型,以及将轨迹表示映射到其回报的凸轨迹回报模型组成。我们的算法在MuJoCo连续控制任务中进行了评估,并在常规设置和延迟奖励设置下均展现出优越的结果。
引用
@article{arxiv.1905.11100,
title = {Disentangling Dynamics and Returns: Value Function Decomposition with Future Prediction},
author = {Hongyao Tang and Jianye Hao and Guangyong Chen and Pengfei Chen and Zhaopeng Meng and Yaodong Yang and Li Wang},
journal= {arXiv preprint arXiv:1905.11100},
year = {2019}
}
备注
10 pages for paper and 6 pages for the supplementary material