基于 Wasserstein 域混淆的强化学习视觉迁移
机器学习
2020-06-08 v1 机器学习
摘要
我们提出 Wasserstein 对抗近端策略优化(WAPPO),一种用于强化学习中视觉迁移的新算法,它显式地学习对齐源任务与目标任务之间提取特征的分布。WAPPO 通过一种新颖的 Wasserstein 混淆目标来近似并最小化源域与目标域特征分布之间的 Wasserstein-1 距离。WAPPO 在视觉迁移上优于先前的最先进技术(SOTA),并成功地在 Visual Cartpole 和 16 个 OpenAI Procgen 环境的两个实例之间迁移策略。
引用
@article{arxiv.2006.03465,
title = {Visual Transfer for Reinforcement Learning via Wasserstein Domain Confusion},
author = {Josh Roy and George Konidaris},
journal= {arXiv preprint arXiv:2006.03465},
year = {2020}
}