UVIP:一种评估强化学习算法的无模型方法
机器学习
2026-01-21 v5 最优化与控制
摘要
策略评估是比较强化学习(RL)中不同算法的重要工具。然而,即便精确已知对应于策略 的值函数 ,也无法提供关于策略 距离最优策略多远的可靠信息。我们提出一种新颖的无模型上值迭代过程({\sf UVIP}),可从上方估计次优间隙 并为 构造置信区间。我们的方法依赖于通过鞅方法对 Bellman 最优方程解的上界。我们在一般假设下为 {\sf UVIP} 提供理论保证,并在若干基准 RL 问题上展示其性能。
引用
@article{arxiv.2105.02135,
title = {UVIP: Model-Free Approach to Evaluate Reinforcement Learning Algorithms},
author = {Denis Belomestny and Ilya Levin and Alexey Naumov and Sergey Samsonov},
journal= {arXiv preprint arXiv:2105.02135},
year = {2026}
}
备注
JOTA camera-ready version