对抗性 MDP 中的策略优化:通过扩张奖励实现改进探索
机器学习
2021-07-20 v1 机器学习
摘要
策略优化是强化学习中广泛使用的方法。然而,由于其局部搜索的本质,关于全局最优性的理论保证往往依赖于对马尔可夫决策过程(MDPs)的额外假设,从而绕过了全局探索的挑战。为消除对此类假设的需求,在本工作中,我们开发了一种通用解决方案,即在策略更新中加入扩张奖励以促进全局探索。为展示该技术的效力与通用性,我们将其应用于若干具有对抗性损失与 bandit 反馈的情节式 MDP 设定,改进并推广了现有最优结果。具体而言,在表格情形下,我们得到 的 regret,其中 为情节数,改进了 Shani 等人(2020)的 regret 界。当状态数无限时,在状态-动作值关于某些低维特征线性的假设下,借助模拟器我们得到 regret,与 Neu 和 Olkhovskaya(2020)的结果相匹配,同时重要地去除其算法所需的探索性策略。当模拟器不可用时,我们进一步考虑线性 MDP 设定并得到 regret,这是针对具有对抗性损失与 bandit 反馈的线性 MDP 的首个结果。
引用
@article{arxiv.2107.08346,
title = {Policy Optimization in Adversarial MDPs: Improved Exploration via Dilated Bonuses},
author = {Haipeng Luo and Chen-Yu Wei and Chung-Wei Lee},
journal= {arXiv preprint arXiv:2107.08346},
year = {2021}
}