中文

对抗性 MDP 中的策略优化:通过扩张奖励实现改进探索

机器学习 2021-07-20 v1 机器学习

摘要

策略优化是强化学习中广泛使用的方法。然而,由于其局部搜索的本质,关于全局最优性的理论保证往往依赖于对马尔可夫决策过程(MDPs)的额外假设,从而绕过了全局探索的挑战。为消除对此类假设的需求,在本工作中,我们开发了一种通用解决方案,即在策略更新中加入扩张奖励以促进全局探索。为展示该技术的效力与通用性,我们将其应用于若干具有对抗性损失与 bandit 反馈的情节式 MDP 设定,改进并推广了现有最优结果。具体而言,在表格情形下,我们得到 O~(T)\widetilde{\mathcal{O}}(\sqrt{T}) 的 regret,其中 TT 为情节数,改进了 Shani 等人(2020)的 O~(T2/3)\widetilde{\mathcal{O}}({T}^{2/3}) regret 界。当状态数无限时,在状态-动作值关于某些低维特征线性的假设下,借助模拟器我们得到 O~(T2/3)\widetilde{\mathcal{O}}({T}^{2/3}) regret,与 Neu 和 Olkhovskaya(2020)的结果相匹配,同时重要地去除其算法所需的探索性策略。当模拟器不可用时,我们进一步考虑线性 MDP 设定并得到 O~(T14/15)\widetilde{\mathcal{O}}({T}^{14/15}) regret,这是针对具有对抗性损失与 bandit 反馈的线性 MDP 的首个结果。

关键词

引用

@article{arxiv.2107.08346,
  title  = {Policy Optimization in Adversarial MDPs: Improved Exploration via Dilated Bonuses},
  author = {Haipeng Luo and Chen-Yu Wei and Chung-Wei Lee},
  journal= {arXiv preprint arXiv:2107.08346},
  year   = {2021}
}