中文

UVIP:一种评估强化学习算法的无模型方法

机器学习 2026-01-21 v5 最优化与控制

摘要

策略评估是比较强化学习(RL)中不同算法的重要工具。然而,即便精确已知对应于策略 π\pi 的值函数 VπV^{\pi},也无法提供关于策略 π\pi 距离最优策略多远的可靠信息。我们提出一种新颖的无模型上值迭代过程({\sf UVIP}),可从上方估计次优间隙 V(x)Vπ(x)V^{\star}(x) - V^{\pi}(x) 并为 VV^\star 构造置信区间。我们的方法依赖于通过鞅方法对 Bellman 最优方程解的上界。我们在一般假设下为 {\sf UVIP} 提供理论保证,并在若干基准 RL 问题上展示其性能。

关键词

引用

@article{arxiv.2105.02135,
  title  = {UVIP: Model-Free Approach to Evaluate Reinforcement Learning Algorithms},
  author = {Denis Belomestny and Ilya Levin and Alexey Naumov and Sergey Samsonov},
  journal= {arXiv preprint arXiv:2105.02135},
  year   = {2026}
}

备注

JOTA camera-ready version