策略缩放:基于自适应离散化的无限视角平均奖励强化学习
机器学习
2025-11-18 v4
摘要
我们研究了针对连续空间 Lipschitz MDP 的无限视角平均奖励强化学习(RL),其中智能体可从给定策略集合 中选择策略。所提出的算法通过“缩放”中“有前景区域”的方式高效探索策略空间,从而在性能上实现自适应收益。我们上界了这些算法的 regret 为 ,其中 (模型无关算法 )和 (模型有关算法 )。这里 为状态空间维数, 为给定策略集合 的缩放维数。 是问题复杂度的另一种度量,取决于底层 MDP 以及 。因此,在问题实例良好且/或智能体对低复杂度 (即 较小)时,所提出的算法表现出低 regret。当针对有限维策略空间时,我们得到 在轻度技术条件下按该空间维数扩展;同时在平均奖励函数满足常见于多臂赌博机(MAB)文献的曲率条件下,得到 ,即 的 regret。
引用
@article{arxiv.2405.18793,
title = {Policy Zooming: Adaptive Discretization-based Infinite-Horizon Average-Reward Reinforcement Learning},
author = {Avik Kar and Rahul Singh},
journal= {arXiv preprint arXiv:2405.18793},
year = {2025}
}
备注
38 pages, 3 figures