度量空间上可证明自适应的平均奖励强化学习
机器学习
2026-02-03 v2 人工智能
摘要
我们研究了 Lipschitz MDP 的无限时间平均奖励强化学习 (RL),该大类涵盖了线性 MDP 和 RKHS MDP 等几类重要的 MDP 以及函数逼近框架,并开发了一种自适应算法 ,其遗憾界为 ,其中 , 是状态空间的维度, 是缩放维度。相比之下,具有固定离散化的算法产生的 ,其中 是动作空间的维度。 通过自适应地离散化状态-动作空间并缩放至状态-动作空间的“有前景区域”来实现这一点。 是一个由状态-动作空间维度界定的依赖于问题的量,它使我们能够得出结论:如果一个 MDP 是良性的,那么 的遗憾界将会很小。缩放维度和 是真正自适应的,即当前工作展示了如何为无限时间平均奖励 RL 捕获自适应增益。 在实验中优于其他 state-of-the-art 算法,从而证明了由自适应带来的增益。
引用
@article{arxiv.2410.19919,
title = {Provably Adaptive Average Reward Reinforcement Learning for Metric Spaces},
author = {Avik Kar and Rahul Singh},
journal= {arXiv preprint arXiv:2410.19919},
year = {2026}
}
备注
Accepted in the 41st Conference on Uncertainty in Artificial Intelligence