中文

蒙特卡罗策略评估中的轨迹截断:一种自适应方法

机器学习 2024-10-18 v1

摘要

通过蒙特卡罗(MC)仿真进行策略评估是许多 MC 强化学习(RL)算法(例如策略梯度方法)的核心。在此上下文中,学习系统的设计者指定与 agent 的交互预算,agent 通常通过在模拟器中收集固定长度的轨迹来花费该预算。然而,这种数据收集策略是否是最佳选项?为此,本文提出作为均方误差的替代指标的一个质量指数,该指数使用长度不同的轨迹,即“被截断”轨迹。具体而言,该替代指数显示固定长度轨迹计划的次优性。此外,它表明采用顺序方式分配可用预算的自适应数据收集策略can 在需要更准确抽样的时刻分配更多的转移,以降低最终估计的误差。基于这些发现,我们提出了一种自适应算法,称为鲁棒和迭代数据收集策略优化(RIDO)。RIDO 的主要直觉是将可用交互预算分为 mini-batch。在每一轮中,agent 判断能够最小化该估计器误差经验性和稳健版本的最佳轨迹计划。After 讨论该方法的理论属性,我们通过在多个领域中进行评估来检验其性能。我们的結果显示,RIDO 能够根据需要在需要更多抽样的时刻调整其轨迹计划,从而提高最终估计的质量。

关键词

引用

@article{arxiv.2410.13463,
  title  = {Truncating Trajectories in Monte Carlo Policy Evaluation: an Adaptive Approach},
  author = {Riccardo Poiani and Nicole Nobili and Alberto Maria Metelli and Marcello Restelli},
  journal= {arXiv preprint arXiv:2410.13463},
  year   = {2024}
}