中文

基于盗贼反馈的乐观策略优化

机器学习 2020-06-19 v2 机器学习

摘要

策略优化方法是最广泛使用的强化学习(RL)算法类别之一。然而,迄今为止,这类方法大多从优化角度进行分析,未能解决探索问题,或对与环境的相互作用做了强假设。本文考虑表格有限时域MDP设定下、具有未知转移和盗贼反馈的基于模型的RL。针对该设定,我们提出一种乐观信赖域策略优化(TRPO)算法,并为其建立了随机奖励下 O~(S2AH4K)\tilde O(\sqrt{S^2 A H^4 K}) 的遗憾界。此外,我们证明了对抗奖励下 O~(S2AH4K2/3)\tilde O( \sqrt{ S^2 A H^4 } K^{2/3} ) 的遗憾界。有趣的是,该结果与先前针对已知转移的盗贼反馈情形导出的界限相匹配。据我们所知,这两个结果是针对具有未知转移和盗贼反馈的策略优化算法所获得的首批次线性遗憾界。

关键词

引用

@article{arxiv.2002.08243,
  title  = {Optimistic Policy Optimization with Bandit Feedback},
  author = {Yonathan Efroni and Lior Shani and Aviv Rosenberg and Shie Mannor},
  journal= {arXiv preprint arXiv:2002.08243},
  year   = {2020}
}

备注

Accepted to ICML 2020