中文

具有低切换代价的可证明高效 Q-Learning

机器学习 2020-02-11 v3 人工智能 机器学习

摘要

我们初步研究具有有限适应性的 PAC-MDP 算法,即在遗憾最小化过程中尽可能少地改变其探索策略的算法。这源于在真实世界应用(如医疗领域)中运行完全自适应算法的困难,我们提出使用局部切换代价概念来量化适应性。我们的主要贡献,带 UCB2 探索的 Q-Learning,是一种用于 H 步分幕 MDP 的无模型算法,其实现了次线性遗憾,在 K 个分幕中的局部切换代价为 O(H3SAlogK)O(H^3SA\log K),并且我们给出了任意无遗憾算法的局部切换代价下界 Ω(HSA)\Omega(HSA)。我们的算法可自然适配并发设定,产生在某些方面改进先前工作的非平凡结果。

关键词

引用

@article{arxiv.1905.12849,
  title  = {Provably Efficient Q-Learning with Low Switching Cost},
  author = {Yu Bai and Tengyang Xie and Nan Jiang and Yu-Xiang Wang},
  journal= {arXiv preprint arXiv:1905.12849},
  year   = {2020}
}

备注

Published at NeurIPS 2019