中文

如何离散化 Q-learning 中的连续状态-动作空间:基于符号控制的方法

系统与控制 2024-06-07 v3 人工智能 系统与控制 动力系统

摘要

Q-learning 被广泛认为是实现特定目标来合成控制器的有效方法。然而,处理连续状态-动作空间所面临的挑战仍是持续的研究焦点。本文提出了系统性分析,突出了空间离散化方法的主要缺陷。为解决这一挑战,本文提出了表示行为关系(如从抽象到受控系统的交替仿真)的符号模型。这种关系允许将基于抽象的合成控制器无缝应用于原始系统。引入 novel Q-learning 技术用于符号模型,该算法产生两个 Q 表,编码最优策略。理论分析表明,这两个 Q 表分别作为原始连续空间系统 Q 值的上界和下界。此外,本文探讨了空间抽象参数与 Q 值损失之间的相关性。 resulting 算法实现了在任意精度内达到最优性,提供了准确性与计算复杂度之间的权衡。获得的结果为选择合适的学习参数和细化控制器提供了宝贵见解。通过两个案例研究展示了基于符号模型的 Q-learning 方法的工程相关性。

关键词

引用

@article{arxiv.2406.01548,
  title  = {How to discretize continuous state-action spaces in Q-learning: A symbolic control approach},
  author = {Sadek Belamfedel Alaoui and Adnane Saoud},
  journal= {arXiv preprint arXiv:2406.01548},
  year   = {2024}
}

备注

Q-learning, Symbolic control, Abstraction