中文

延迟自适应策略优化及带延迟Bandit反馈的对抗MDP的改进后悔界

机器学习 2023-05-16 v1

摘要

策略优化(PO)是强化学习(RL)中最流行的方法之一。因此,PO算法的理论保证对RL领域变得尤为重要。在本文中,我们研究对抗MDP中的PO,其面临一个几乎在每个现实应用中都会出现的挑战——延迟bandit反馈。我们给出了表格MDP中PO的首个近最优后悔界,甚至可能超越最先进水平(其使用了效率较低的方法)。我们新颖的延迟自适应PO(DAPO)易于实现和泛化,使我们能将算法扩展至:(i)在线性QQ函数假设下的无限状态空间,证明了带函数近似的延迟反馈的首个后悔界。(ii)深度RL,在MuJoCo域上的实验展示了其有效性。

关键词

引用

@article{arxiv.2305.07911,
  title  = {Delay-Adapted Policy Optimization and Improved Regret for Adversarial MDP with Delayed Bandit Feedback},
  author = {Tal Lancewicki and Aviv Rosenberg and Dmitry Sotnikov},
  journal= {arXiv preprint arXiv:2305.07911},
  year   = {2023}
}

备注

ICML 2023