中文

真正确定性的策略优化

人工智能 2022-06-01 v1 机器学习 机器人学 系统与控制 系统与控制

摘要

本文提出一种避免探索性噪声注入、并在确定性 landscape 上执行策略搜索的策略梯度方法。通过避免噪声注入,在具有确定性动力学的系统中(直至初始状态分布)可消除所有估计方差来源。由于使用 KL 散度等传统非度量测度无法对确定性策略进行正则化,我们推导了一种基于 Wasserstein 的二次模型以资应用。我们给出了系统模型上可建立单调策略改进保证的条件,提出了用于策略梯度估计的替代函数,并表明在状态转移模型与策略均为确定性时,可计算精确优势估计。最后,我们描述了两个新颖的机器人控制环境——一个具有频域中的非局部奖励,另一个具有长时域(8000 时间步)——我们的策略梯度方法(TDPO)显著优于现有方法(PPO、TRPO、DDPG 与 TD3)。我们包含所有实验设置的实现可在 https://github.com/ehsansaleh/code_tdpo 获取。

关键词

引用

@article{arxiv.2205.15379,
  title  = {Truly Deterministic Policy Optimization},
  author = {Ehsan Saleh and Saba Ghaffari and Timothy Bretl and Matthew West},
  journal= {arXiv preprint arXiv:2205.15379},
  year   = {2022}
}