情节式强化学习中的抗 corrupted 探索
机器学习
2023-11-02 v4 人工智能
数据结构与算法
机器学习
摘要
我们开启了在多阶段情节式强化学习中研究奖励和底层系统转移概率均受对抗性腐蚀的研究,扩展了近期针对随机老虎机特例的结果。我们提供了一个框架,该框架修改了现有基于“面对不确定性乐观”的强化学习方法所享有的激进探索,辅以“动作消除”的原则。重要的是,我们的框架规避了在RL设置中朴素应用动作消除所带来的主要挑战,这由我们证明的一个下界所形式化。我们的框架产生了高效算法,其(a)在无腐蚀时达到近最优后悔界,且(b)适应未知水平的腐蚀,享有随遭遇的总腐蚀量优雅退化的后悔保证。为展示我们方法的通用性,我们推导了表格设置(状态和动作有限)以及线性函数逼近设置(动态和奖励具有线性底层表示)的结果。值得注意的是,我们的工作提供了首个亚线性后悔保证,其容纳了情节式强化学习老虎机反馈模型中任何偏离纯i.i.d.转移的情况。
引用
@article{arxiv.1911.08689,
title = {Corruption-robust exploration in episodic reinforcement learning},
author = {Thodoris Lykouris and Max Simchowitz and Aleksandrs Slivkins and Wen Sun},
journal= {arXiv preprint arXiv:1911.08689},
year = {2023}
}
备注
Accepted in Mathematics of Operations Research. Preliminary version was accepted for presentation at COLT'21