中文

用于随机控制中离屏策略评估的 K 近邻重采样方法

机器学习 2024-01-11 v2 机器学习 最优化与控制 统计理论 统计方法学 统计理论

摘要

在本文中,我们提出了一种新颖的 K 近邻重采样过程,用于从历史数据中估计策略的性能,该历史数据包含在另一策略下生成的决策过程的已实现片段。我们在弱条件下给出了统计一致性结果。特别地,我们避免了关于转移和奖励独立同分布的常见假设。相反,我们的分析允许对完整片段进行采样,这是大多数应用中的常见做法。为了在此设定下建立一致性,我们将 Stone 定理(非参数统计中关于局部平均的著名结果)推广到包含片段数据以及离屏策略评估(OPE)背后的反事实估计。通过关注在具有连续状态-动作空间和由所选动作引起的系统固有随机性的环境中确定性依赖于当前状态的反馈策略,并依赖类似于蒙特卡洛方法的轨迹模拟,所提方法特别适用于随机控制环境。与其他 OPE 方法相比,我们的算法不需要优化,可通过基于树的最近邻搜索和并行化高效实现,并且不明确假设环境动态的的参数化模型。数值实验证明了该算法在多种随机控制设定(包括线性二次调节器、限价订单簿中的交易执行以及在线随机装箱)中与现有基线相比的有效性。

关键词

引用

@article{arxiv.2306.04836,
  title  = {$K$-Nearest-Neighbor Resampling for Off-Policy Evaluation in Stochastic Control},
  author = {Michael Giegrich and Roel Oomen and Christoph Reisinger},
  journal= {arXiv preprint arXiv:2306.04836},
  year   = {2024}
}