中文

平均奖励与episodic强化学习的乐观 Q 学习

机器学习 2025-06-17 v3 机器学习

摘要

我们提出了一种用于平均奖励强化学习中最小化后悔的乐观 Q 学习算法,假设 underlying MDP 满足:对于所有策略,访问某个频繁状态 s0s_0 的时间是有限的且上界为 HH,这种情况要么是预期,要么是常数概率。我们的设置严格推广了episodic设置,显著宽松于大多数关于 model-free 在平均奖励设置下假设状态访问时间有界的文献。我们展示了 O~(H5SAT)\tilde{O}(H^5 S\sqrt{AT}) 的后悔上界,其中 SSAA 分别为状态数和动作数,TT 为时间步长。我们工作的关键技术新颖性在于引入 L\overline{L} 算子,定义为 Lv=1Hh=1HLhv\overline{L} v = \frac{1}{H} \sum_{h=1}^H L^h v,其中 LL 表示 Bellman 算子。我们证明在给定假设下,L\overline{L} 算子即使在折扣因子为 1 的平均奖励设置下,也在 span 度量下具有严格收缩。我们的算法设计借鉴了episodic Q 学习的思想,迭代地估计并应用该算子。因此,我们提供了episodic 与 non-episodic 设置下后悔最小化的统一视角,这可能本身感兴趣。

关键词

引用

@article{arxiv.2407.13743,
  title  = {Optimistic Q-learning for average reward and episodic reinforcement learning},
  author = {Priyank Agrawal and Shipra Agrawal},
  journal= {arXiv preprint arXiv:2407.13743},
  year   = {2025}
}

备注

37 pages, simplified proofs