中文

分布式的益处:强化学习中的小损失界

机器学习 2023-09-26 v3 人工智能 最优化与控制 统计理论 机器学习 统计理论

摘要

尽管分布式强化学习(DistRL)在经验上十分有效,但它在何时以及为何优于朴素的非分布式 RL 这一问题一直未得到解答。本文通过小损失界(small-loss bounds)的视角解释 DistRL 的益处,这类界是依赖于具体实例、随最优可达代价缩放的界。特别地,若最优代价较小,我们的界比非分布式方法的界收敛得快得多。作为铺垫,我们提出一种分布式上下文赌博机(DistCB)算法,并证明其具有小损失遗憾界,且在三个真实任务上实证优于最先进方法。在线 RL 中,我们提出一种利用极大似然估计构造置信集的 DistRL 算法。我们证明该算法在低秩 MDP 中享有新颖的小损失 PAC 界。作为分析的一部分,我们引入了 1\ell_1 分布式 eluder 维数,其本身可能具有独立意义。随后,在离线 RL 中,我们证明悲观 DistRL 享有对离线设定而言新颖的小损失 PAC 界,且对糟糕的单策略覆盖更为鲁棒。

关键词

引用

@article{arxiv.2305.15703,
  title  = {The Benefits of Being Distributional: Small-Loss Bounds for Reinforcement Learning},
  author = {Kaiwen Wang and Kevin Zhou and Runzhe Wu and Nathan Kallus and Wen Sun},
  journal= {arXiv preprint arXiv:2305.15703},
  year   = {2023}
}

备注

Accepted at NeurIPS 2023