平均奖励与episodic强化学习的乐观 Q 学习
机器学习
2025-06-17 v3 机器学习
摘要
我们提出了一种用于平均奖励强化学习中最小化后悔的乐观 Q 学习算法,假设 underlying MDP 满足:对于所有策略,访问某个频繁状态 的时间是有限的且上界为 ,这种情况要么是预期,要么是常数概率。我们的设置严格推广了episodic设置,显著宽松于大多数关于 model-free 在平均奖励设置下假设状态访问时间有界的文献。我们展示了 的后悔上界,其中 和 分别为状态数和动作数, 为时间步长。我们工作的关键技术新颖性在于引入 算子,定义为 ,其中 表示 Bellman 算子。我们证明在给定假设下, 算子即使在折扣因子为 1 的平均奖励设置下,也在 span 度量下具有严格收缩。我们的算法设计借鉴了episodic Q 学习的思想,迭代地估计并应用该算子。因此,我们提供了episodic 与 non-episodic 设置下后悔最小化的统一视角,这可能本身感兴趣。
引用
@article{arxiv.2407.13743,
title = {Optimistic Q-learning for average reward and episodic reinforcement learning},
author = {Priyank Agrawal and Shipra Agrawal},
journal= {arXiv preprint arXiv:2407.13743},
year = {2025}
}
备注
37 pages, simplified proofs