中文

带 Wasserstein 距离正则化的强化学习及其在多策略学习中的应用

机器学习 2019-08-01 v2 人工智能

摘要

我们描述了 Wasserstein 距离在强化学习中的一种应用。所讨论的 Wasserstein 距离介于某策略轨迹映射到某度量空间后的分布与另一固定分布(例如可来自另一策略)之间。不同策略诱导出不同分布,因此给定底层度量后,Wasserstein 距离量化了策略间的差异程度。这可用于通过学习 Wasserstein 正则化项来学习多个在该 Wasserstein 距离意义下互异的策略。改变正则化参数的符号,可学习一个其轨迹映射分布被吸引至给定固定分布的策略。

关键词

引用

@article{arxiv.1802.03976,
  title  = {Reinforcement Learning with Wasserstein Distance Regularisation, with Applications to Multipolicy Learning},
  author = {Mohammed Amin Abdullah and Aldo Pacchiano and Moez Draief},
  journal= {arXiv preprint arXiv:1802.03976},
  year   = {2019}
}