中文

强化学习中的锐利方差相关界:随机与确定性环境的双赢

机器学习 2023-05-23 v3 机器学习

摘要

我们研究马尔可夫决策过程(MDP)的方差相关后悔界。具有方差相关后悔保证的算法可自动利用低方差环境(例如,在确定性 MDP 上享有常数后悔)。现有算法要么方差无关要么次优。我们首先提出两种新环境范数以刻画环境的细粒度方差性质。对基于模型的方法,我们设计 MVP 算法(Zhang et al., 2021a)的一个变体。我们应用新分析技术证明该算法享有相对于我们所提范数的方差相关界。特别地,该界对随机与确定性 MDP 同时极小极大最优,系此类首例结果。我们进一步通过设计一种基于参考函数、带新颖封顶翻倍参考更新机制的算法,开启对具有方差相关后悔界的免模型算法研究。最后,我们也提供下界以补充上界。

关键词

引用

@article{arxiv.2301.13446,
  title  = {Sharp Variance-Dependent Bounds in Reinforcement Learning: Best of Both Worlds in Stochastic and Deterministic Environments},
  author = {Runlong Zhou and Zihan Zhang and Simon S. Du},
  journal= {arXiv preprint arXiv:2301.13446},
  year   = {2023}
}

备注

ICML 2023