中文

作为鲁棒强化学习框架的零和位置微分博弈:深度Q学习算法

机器学习 2024-05-06 v1 人工智能 计算机科学与博弈论 系统与控制 系统与控制 最优化与控制

摘要

鲁棒强化学习(Robust Reinforcement Learning, RRL)是一种很有前景的强化学习(RL)范式,旨在训练对不确定性或扰动具有鲁棒性的模型,使其在现实世界应用中更加高效。遵循这一范式,不确定性或扰动被解释为第二个对抗性智能体的动作,因此,问题被简化为寻找对任何对手动作都具有鲁棒性的智能体策略。本文首次提出在位置微分博弈理论框架内考虑RRL问题,这有助于我们获得理论上有依据的直觉,从而开发一种集中式Q学习方法。具体而言,我们证明了在Isaacs条件下(该条件对现实世界动态系统具有足够的普适性),同一个Q函数可以作为最小最大和最大最小贝尔曼方程的近似解。基于这些结果,我们提出了Isaacs深度Q网络算法,并在多种环境中展示了其相较于其他基线RRL和多智能体RL算法的优越性。

关键词

引用

@article{arxiv.2405.02044,
  title  = {Zero-Sum Positional Differential Games as a Framework for Robust Reinforcement Learning: Deep Q-Learning Approach},
  author = {Anton Plaksin and Vitaly Kalev},
  journal= {arXiv preprint arXiv:2405.02044},
  year   = {2024}
}