中文

Average-DICE:基于回归的平稳分布校正

机器学习 2025-08-12 v2

摘要

离线策略评估(OPE)是强化学习的重要组成部分,长期以来一直受到平稳状态分布不匹配的困扰,这削弱了 OPE 估计的稳定性和准确性。虽然现有方法通过估计密度比来校正分布偏移,但它们通常依赖于昂贵的优化或基于后向 Bellman 的更新,并且难以超越简单的基线。我们引入了 AVG-DICE,这是一种计算简单的蒙特卡洛密度比估计器,它对折扣重要性采样比进行平均,从而提供无偏且一致的校正。AVG-DICE 利用回归自然地扩展到非线性函数近似,我们在基于 Mujoco Gym 环境的 OPE 任务上对其进行了粗略调优和测试,并使用其报告的超参数与最先进的密度比估计器进行了比较。在我们的实验中,AVG-DICE 至少与最先进的估计器一样准确,有时甚至能提供几个数量级的改进。然而,敏感性分析表明,表现最佳的超参数可能因折扣因子的不同而有很大差异,因此建议进行重新调优。

关键词

引用

@article{arxiv.2503.02125,
  title  = {Average-DICE: Stationary Distribution Correction by Regression},
  author = {Fengdi Che and Bryan Chan and Chen Ma and A. Rupam Mahmood},
  journal= {arXiv preprint arXiv:2503.02125},
  year   = {2025}
}