中文

基于 Wasserstein 约束的鲁棒强化学习

机器学习 2020-06-02 v1 机器学习

摘要

鲁棒强化学习旨在寻找对环境动态具有一定鲁棒性的最优策略。现有学习算法通常通过以启发式方式扰动当前状态或模拟环境参数来实现鲁棒性,缺乏对系统动态(即转移概率)的量化鲁棒性。为克服该问题,我们利用 Wasserstein 距离来度量对参考转移核的扰动。借助 Wasserstein 距离,我们能够将转移核扰动与状态扰动联系起来,即将无限维优化问题化简为有限维风险感知问题。通过推导出的风险感知最优 Bellman 方程,我们证明了最优鲁棒策略的存在性,给出了对扰动的敏感性分析,并设计了一种新颖的鲁棒学习算法——Wasserstein 鲁棒优势 actor-critic 算法(WRAAC)。所提算法的有效性在 Cart-Pole 环境中得到验证。

关键词

引用

@article{arxiv.2006.00945,
  title  = {Robust Reinforcement Learning with Wasserstein Constraint},
  author = {Linfang Hou and Liang Pang and Xin Hong and Yanyan Lan and Zhiming Ma and Dawei Yin},
  journal= {arXiv preprint arXiv:2006.00945},
  year   = {2020}
}