面向深度强化学习的具有不确定性感知的低秩 Q 矩阵估计
机器学习
2021-11-22 v1 人工智能
机器学习
摘要
价值估计是强化学习中的关键问题。尽管深度强化学习(DRL)在不同领域取得诸多成功,价值函数的底层结构与学习动态,尤其在复杂函数逼近下,尚未被充分理解。本文报告称,在一系列连续控制任务中,针对不同流行算法,学习过程中 矩阵秩的下降广泛存在。我们假设该低秩现象表明了 矩阵从随机高维空间到平滑低维空间的通用学习动态。此外,我们揭示了价值矩阵秩与价值估计不确定性间的正相关性。受上述证据启发,我们提出一种新颖的不确定性感知低秩 Q 矩阵估计(UA-LQE)算法作为通用框架以促进价值函数学习。通过量化状态-动作价值估计的不确定性,我们有选择地擦除状态-动作价值矩阵中高不确定性值的条目,并对其做低秩矩阵重构以恢复其值。此种重构利用价值矩阵的底层结构改善价值逼近,从而带来更高效的价值函数学习过程。实验中,我们在若干代表性 OpenAI MuJoCo 连续控制任务上评估了 UA-LQE 的效用。
引用
@article{arxiv.2111.10103,
title = {Uncertainty-aware Low-Rank Q-Matrix Estimation for Deep Reinforcement Learning},
author = {Tong Sang and Hongyao Tang and Jianye Hao and Yan Zheng and Zhaopeng Meng},
journal= {arXiv preprint arXiv:2111.10103},
year = {2021}
}
备注
This paper is accepted by The 3rd International Conference on Distributed Artificial Intelligence (DAI 2021, Shanghai, China)