中文

统一 PAC 与 Regret:情景强化学习的 Uniform PAC 界

机器学习 2018-01-03 v3 人工智能 机器学习

摘要

强化学习 (RL) 算法的统计性能界对于医疗保健等高风险应用至关重要。本文引入了一种新的用于理论上衡量此类算法性能的框架,称为 Uniform-PAC,它是经典的可能近似正确 (PAC) 框架的强化。与 PAC 框架相比,其一致版本可用于推导高概率 regret 保证,从而在文献中缺失的两种设定之间架起了一座桥梁。我们用一个新算法展示了该新框架在有限状态情景 MDP 中的优势,该算法是 Uniform-PAC 的,并且除了一个与 horizon 相关的因子外,同时实现了最优的 regret 和 PAC 保证。

关键词

引用

@article{arxiv.1703.07710,
  title  = {Unifying PAC and Regret: Uniform PAC Bounds for Episodic Reinforcement Learning},
  author = {Christoph Dann and Tor Lattimore and Emma Brunskill},
  journal= {arXiv preprint arXiv:1703.07710},
  year   = {2018}
}

备注

appears in Neural Information Processing Systems 2017