中文

非平稳环境中近最优的目标导向强化学习

机器学习 2022-05-27 v1

摘要

我们开启了对以非平稳随机最短路径问题建模的目标导向强化学习的动态后悔最小化的研究,该问题具有变化的代价函数和转移函数。我们首先建立下界 Ω((BSAT(Δc+B2ΔP))1/3K2/3)\Omega((B_{\star} SAT_{\star}(\Delta_c + B_{\star}^2\Delta_P))^{1/3}K^{2/3}),其中 BB_{\star} 是从任意状态开始的任一回合的最优策略的最大期望代价,TT_{\star} 是从初始状态开始的任一回合的最优策略的最大命中时间,SASA 是状态-动作对的数量,Δc\Delta_cΔP\Delta_P 分别是代价函数和转移函数的变化量,KK 是回合数。该下界中 Δc\Delta_cΔP\Delta_P 的不同作用启发我们设计分别估计代价和转移的算法。具体而言,在已知 Δc\Delta_cΔP\Delta_P 的假设下,我们开发了一个简单但次优的算法以及另一个更复杂的极小极大最优算法(至对数项)。这些算法结合了有限时域近似 [Chen et al., 2022a]、MVP 算法 [Zhang et al., 2020] 特殊的 Bernstein 式奖励、自适应置信度扩张 [Wei and Luo, 2021] 以及某些新技术(如适当惩罚长时域策略)的思想。最后,当 Δc\Delta_cΔP\Delta_P 未知时,我们开发了 MASTER 算法 [Wei and Luo, 2021] 的一个变体,并将上述思想整合其中,以实现 O~(min{BSALK,(B2S2AT(Δc+BΔP))1/3K2/3})\widetilde{O}(\min\{B_{\star} S\sqrt{ALK}, (B_{\star}^2S^2AT_{\star}(\Delta_c+B_{\star}\Delta_P))^{1/3}K^{2/3}\}) 后悔,其中 LL 是环境未知的变化次数。

关键词

引用

@article{arxiv.2205.13044,
  title  = {Near-Optimal Goal-Oriented Reinforcement Learning in Non-Stationary Environments},
  author = {Liyu Chen and Haipeng Luo},
  journal= {arXiv preprint arXiv:2205.13044},
  year   = {2022}
}