中文

平均奖励强化学习中与跨度无关的最优样本复杂度与Oracle不等式

机器学习 2025-06-02 v1 信息论 math.IT 最优化与控制 机器学习

摘要

我们研究了在具有生成模型的平均奖励马尔可夫决策过程(MDP)中寻找ε\varepsilon-最优策略的样本复杂度。基于跨度的最优复杂度O~(SAH/ε2)\widetilde{O}(SAH/\varepsilon^2)(其中HH为最优偏置函数的跨度)仅在先验已知HH值时才能实现。先验知识无关的算法一直是密集研究的目标,但若干自然方法被证明无法达成此目标。我们解决了这一问题,开发了首个在不依赖HH知识的情况下匹配最优跨度复杂度的算法,无论在数据集大小固定还是次优性水平ε\varepsilon固定的情况下。我们的主要技术结合了折扣约化方法与一种基于经验置信区间或性能下界自动调节有效视野的方法,我们称之为视野校准。我们还开发了一种受样本方差惩罚启发的经验跨度惩罚方法,满足Oracle不等式性能保证。特别地,该算法在良性设置下(如存在跨度远小于HH的近最优策略时)可以超越最坏情况复杂度。

关键词

引用

@article{arxiv.2502.11238,
  title  = {Span-Agnostic Optimal Sample Complexity and Oracle Inequalities for Average-Reward RL},
  author = {Matthew Zurek and Yudong Chen},
  journal= {arXiv preprint arXiv:2502.11238},
  year   = {2025}
}