CT-DQN:控制辅导的深度强化学习
机器学习
2022-12-05 v1 系统与控制
系统与控制
最优化与控制
摘要
深度强化学习用于控制的主要挑战之一是需要进行大量训练以学习策略。受此启发,我们提出了控制辅导深度Q网络(CT-DQN)算法的设计,这是一种利用控制辅导器(即 exogenous 控制律)来减少学习时间的深度强化学习算法。辅导器可使用系统的近似模型来设计,无需对系统动态的已知情况作任何假设。若单独使用,并不期望其能够实现控制目标。在学习过程中,辅导器偶尔建议一个动作,从而部分地引导探索。我们在来自 OpenAI Gym 的三个场景上验证了我们的方法:倒立摆、月球着陆器和赛车。我们证明,相对于经典的函数逼近方案,CT-DQN 能够实现更好或相当的数据效率。
引用
@article{arxiv.2212.01343,
title = {CT-DQN: Control-Tutored Deep Reinforcement Learning},
author = {Francesco De Lellis and Marco Coraggio and Giovanni Russo and Mirco Musolesi and Mario di Bernardo},
journal= {arXiv preprint arXiv:2212.01343},
year = {2022}
}