中文

Q-MMR:基于递归重加权与矩匹配的离策略评估

机器学习 2026-05-11 v2 人工智能 机器学习

摘要

我们提出了一个新颖的理论框架 Q-MMR,用于有限时域 MDP 中的离策略评估。Q-MMR 学习一组标量权重(每个数据点一个),使得重加权的奖励逼近目标策略下的期望回报。这些权重通过针对价值函数判别器类的矩匹配目标,以自上而下的归纳方式进行学习。值得注意的是,且或许令人惊讶的是,在仅要求 QπQ^\pi 可实现的条件下,即可为一般函数逼近建立数据相关的有限样本保证,且具有与维度无关的界限——即误差不依赖于函数类的统计复杂度。我们还建立了其与重要性采样和线性 FQE 等几种现有方法的联系。进一步的理论分析为覆盖(coverage)的本质提供了新见解,而覆盖是对离线 RL 具有根本重要性的概念。

关键词

引用

@article{arxiv.2605.06474,
  title  = {Q-MMR: Off-Policy Evaluation via Recursive Reweighting and Moment Matching},
  author = {Xiang Li and Nan Jiang},
  journal= {arXiv preprint arXiv:2605.06474},
  year   = {2026}
}