中文

Feudal Q-learning 的收敛性与稳定性

机器学习 2025-11-24 v1 系统与控制 系统与控制 最优化与控制

摘要

层次强化学习承诺能够高效地捕获和利用决策问题的时序结构,并增强持续学习能力,但理论保证滞后于实际应用。在本文中,我们提出了一种 Feudal Q-learning 框架,探讨其耦合更新在何种条件下收敛且稳定。通过利用随机逼近理论和 ODE 方法,我们提出了一个阐明 Feudal Q-learning 收敛性和稳定性性质的定理。这为针对 Feudal RL 提供了原则化的收敛性和稳定性分析。此外,我们展示了这些更新收敛到一个可解释为某种特定定义游戏平衡点的点,为层次强化学习的博弈论方法打开了可能性。最后,基于 Feudal Q-learning 算法的实验支持了理论预期的结果。

关键词

引用

@article{arxiv.2511.17351,
  title  = {Convergence and stability of Q-learning in Hierarchical Reinforcement Learning},
  author = {Massimiliano Manenti and Andrea Iannelli},
  journal= {arXiv preprint arXiv:2511.17351},
  year   = {2025}
}