中文

基于 Wasserstein 域混淆的强化学习视觉迁移

机器学习 2020-06-08 v1 机器学习

摘要

我们提出 Wasserstein 对抗近端策略优化(WAPPO),一种用于强化学习中视觉迁移的新算法,它显式地学习对齐源任务与目标任务之间提取特征的分布。WAPPO 通过一种新颖的 Wasserstein 混淆目标来近似并最小化源域与目标域特征分布之间的 Wasserstein-1 距离。WAPPO 在视觉迁移上优于先前的最先进技术(SOTA),并成功地在 Visual Cartpole 和 16 个 OpenAI Procgen 环境的两个实例之间迁移策略。

关键词

引用

@article{arxiv.2006.03465,
  title  = {Visual Transfer for Reinforcement Learning via Wasserstein Domain Confusion},
  author = {Josh Roy and George Konidaris},
  journal= {arXiv preprint arXiv:2006.03465},
  year   = {2020}
}