面向深度 Q 学习中发散性特征的刻画
机器学习
2019-03-22 v1 人工智能
摘要
深度 Q 学习(DQL)是一类用于控制的时序差分算法族,采用了强化学习中统称为“致命三元组”的三种技术:自举、离策略学习与函数逼近。先前工作已表明,三者共同可导致 Q 学习算法发散,但发散发生的条件尚不清晰。在本札记中,我们基于 Q 值更新的线性近似给出一种简明的分析,相信其能深化对致命三元组下发散性的理解。我们分析的核心在于考察深度 Q 更新的一阶近似在 sup 范数下是否为压缩映射。基于此分析,我们开发了一种算法,可在无需任何常规技巧(如目标网络、自适应梯度优化器或多 Q 函数)的情况下实现稳定的连续控制深度 Q 学习。我们证明,在来自 OpenAI Gym 的标准 MuJoCo 基准上,该算法表现优于或接近 SOTA。
引用
@article{arxiv.1903.08894,
title = {Towards Characterizing Divergence in Deep Q-Learning},
author = {Joshua Achiam and Ethan Knight and Pieter Abbeel},
journal= {arXiv preprint arXiv:1903.08894},
year = {2019}
}