中文

深度 Q 学习:一种鲁棒控制方法

机器学习 2022-11-08 v2

摘要

本文将深度 Q 学习置于面向控制的视角,并借助鲁棒控制中成熟的技术研究其学习动态。我们通过神经正切核建立不确定线性时不变模型以描述学习过程。我们展示了学习的不稳定性,并从频域分析了智能体的行为。随后,我们通过作为损失函数中动态奖励的鲁棒控制器确保收敛。我们综合了三种控制器:状态反馈增益调度 H2、动态 Hinf 和常增益 Hinf 控制器。相较于强化学习中的启发式方法,以面向控制的调参方法设置学习智能体更为透明且有完备文献支撑。此外,我们的方法不使用目标网络与随机回放记忆。目标网络的作用由控制输入取代,后者也利用了样本的时间依赖性(与随机记忆缓冲相反)。在不同 OpenAI Gym 环境中的数值仿真表明,Hinf 控制的学习表现略优于 Double deep Q-learning。

关键词

引用

@article{arxiv.2201.08610,
  title  = {Deep Q-learning: a robust control approach},
  author = {Balazs Varga and Balazs Kulcsar and Morteza Haghir Chehreghani},
  journal= {arXiv preprint arXiv:2201.08610},
  year   = {2022}
}