SaVeR: 表格 MDP 中安全策略评估的最优数据收集策略
机器学习
2024-06-05 v1
摘要
在本文中,我们研究了在表格马尔可夫决策过程中为策略评估目的而进行的安全数据收集。在策略评估中,我们被给定一个\textit{目标}策略,并要求估计其将获得的期望累积奖励。策略评估需要数据,我们感兴趣的问题是,为了最准确地评估目标策略,应该使用什么\textit{行为}策略来收集数据。虽然先前的工作已经考虑了行为策略的选择,但在本文中,我们额外考虑了行为策略上的安全约束。具体来说,我们假设存在一个已知的默认策略,它在运行时会产生特定的期望成本,并且我们强制执行所有运行的行为策略的累积成本优于始终运行默认策略所产生的成本的一个常数因子。我们首先证明存在一类难以处理的 MDP,其中没有了解问题参数的安全 oracle 算法能够有效地收集数据并满足安全约束。然后,我们定义了一个 MDP 的可处理性条件,使得安全 oracle 算法能够有效地收集数据,并利用该条件证明了该设置的第一个下界。接着,我们针对此问题引入了一种算法 SaVeR,该算法近似于安全 oracle 算法,并在确保满足安全约束的同时,限制了算法的有限样本均方误差。最后,我们在仿真中表明,SaVeR 在满足安全约束的同时,产生了低 MSE 的策略评估。
引用
@article{arxiv.2406.02165,
title = {SaVeR: Optimal Data Collection Strategy for Safe Policy Evaluation in Tabular MDP},
author = {Subhojyoti Mukherjee and Josiah P. Hanna and Robert Nowak},
journal= {arXiv preprint arXiv:2406.02165},
year = {2024}
}