深度 Q 学习:一种鲁棒控制方法
机器学习
2022-11-08 v2
摘要
本文将深度 Q 学习置于面向控制的视角,并借助鲁棒控制中成熟的技术研究其学习动态。我们通过神经正切核建立不确定线性时不变模型以描述学习过程。我们展示了学习的不稳定性,并从频域分析了智能体的行为。随后,我们通过作为损失函数中动态奖励的鲁棒控制器确保收敛。我们综合了三种控制器:状态反馈增益调度 H2、动态 Hinf 和常增益 Hinf 控制器。相较于强化学习中的启发式方法,以面向控制的调参方法设置学习智能体更为透明且有完备文献支撑。此外,我们的方法不使用目标网络与随机回放记忆。目标网络的作用由控制输入取代,后者也利用了样本的时间依赖性(与随机记忆缓冲相反)。在不同 OpenAI Gym 环境中的数值仿真表明,Hinf 控制的学习表现略优于 Double deep Q-learning。
引用
@article{arxiv.2201.08610,
title = {Deep Q-learning: a robust control approach},
author = {Balazs Varga and Balazs Kulcsar and Morteza Haghir Chehreghani},
journal= {arXiv preprint arXiv:2201.08610},
year = {2022}
}