用于离线策略评估的原-对偶谱表示
机器学习
2024-10-24 v1 人工智能
最优化与控制
摘要
离线策略评估(OPE)是强化学习(RL)中最基本的问题之一,旨在仅利用来自另一个可能未知的行为策略的经验,来估计给定目标策略的期望长期回报。分布校正估计(DICE)系列估计器通过打破视界诅咒,推进了OPE的最新技术水平。然而,应用DICE估计器的主要瓶颈在于解决所涉及的鞍点优化的困难,尤其是在神经网络实现中。在本文中,我们通过利用转移算子的谱分解,建立价值函数和稳态分布校正比(即DICE框架中的原变量和对偶变量)的线性表示来应对这一挑战。这种原-对偶表示不仅绕过了原始DICE中的非凸非凹优化,从而实现了计算高效的算法,而且为更有效地利用历史数据铺平了道路。我们强调,我们的算法SpectralDICE是第一个利用原-对偶变量线性表示的算法,该算法既计算高效又样本高效,其性能得到了严格的理论样本复杂度保证和在各种基准上的全面实证评估的支持。
引用
@article{arxiv.2410.17538,
title = {Primal-Dual Spectral Representation for Off-policy Evaluation},
author = {Yang Hu and Tianyi Chen and Na Li and Kai Wang and Bo Dai},
journal= {arXiv preprint arXiv:2410.17538},
year = {2024}
}
备注
29 pages, 5 figures