中文

平滑策略与安全的策略梯度

机器学习 2022-06-20 v2 机器学习

摘要

策略梯度(PG)算法是将强化学习应用于现实世界控制任务(如机器人技术)的最受期待的候选方案之一。然而,每当学习过程本身必须在物理系统上执行或涉及任何形式的人机交互时,这些方法的试错本质就会引发安全问题。在本文中,我们探讨了一种特定的安全设定,其中目标和危险都被编码在标量奖励信号中,且学习智能体被约束为绝不降低其以奖励期望和衡量的性能。通过从随机优化的角度研究仅执行者策略梯度,我们为一大类参数化策略建立了改进保证,推广了高斯策略的现有结果。这与策略梯度估计方差的新上界相结合,使我们能够确定以高概率保证单调改进的元参数调度。两个关键的元参数是参数更新的步长和梯度估计的批量大小。通过对这些元参数的联合自适应选择,我们获得了一种具有单调改进保证的策略梯度算法。

关键词

引用

@article{arxiv.1905.03231,
  title  = {Smoothing Policies and Safe Policy Gradients},
  author = {Matteo Papini and Matteo Pirotta and Marcello Restelli},
  journal= {arXiv preprint arXiv:1905.03231},
  year   = {2022}
}