中文

迈向无混合时间预言机的实用平均奖励强化学习的全局最优性

机器学习 2024-06-24 v5

摘要

在平均奖励强化学习的背景下,对混合时间(即马尔可夫链在固定策略下达到其平稳分布所需时长的度量)的预言机知识的要求,对策略梯度方法的全局收敛构成了重大挑战。由于在具有大状态空间的环境中估计混合时间既困难又昂贵,导致在实际应用中需要不切实际的极长轨迹才能进行有效的梯度估计,这一要求尤为棘手。为了解决这一局限性,我们考虑了结合多层蒙特卡洛(MLMC)梯度估计器的多层 Actor-Critic(MAC)框架。通过我们的方法,有效缓解了对混合时间知识的依赖,这在平均奖励 MDP 全局收敛中尚属首次。此外,我们的方法展现了先前工作中已知的最紧的 O(τmix)\mathcal{O}\left( \sqrt{\tau_{mix}} \right) 依赖关系。通过二维网格世界目标到达导航实验,我们证明了 MAC 在平均奖励设置下优于现有的基于策略梯度的最先进方法。

关键词

引用

@article{arxiv.2403.11925,
  title  = {Towards Global Optimality for Practical Average Reward Reinforcement Learning without Mixing Time Oracles},
  author = {Bhrij Patel and Wesley A. Suttle and Alec Koppel and Vaneet Aggarwal and Brian M. Sadler and Amrit Singh Bedi and Dinesh Manocha},
  journal= {arXiv preprint arXiv:2403.11925},
  year   = {2024}
}

备注

26 Pages, 2 Figures