MULTIPOLAR:面向异构环境动力学间迁移强化学习的多源策略聚合
机器学习
2020-12-11 v2 机器学习
摘要
迁移强化学习(RL)旨在通过利用在相关任务上训练的其他源智能体的知识来提高智能体的学习效率。然而,在无法访问源环境的情况下,在不同环境动力学之间迁移知识仍然具有挑战性。在这项工作中,我们探索了迁移 RL 中的一个新挑战,即仅有一组在多样未知动力学下收集的源策略可用于高效学习目标任务。为解决该问题,所提出的方法 MULTI-source POLicy AggRegation(MULTIPOLAR)包含两项关键技术。我们学习自适应地聚合由源策略提供的动作,以最大化目标任务性能。同时,我们学习一个辅助网络,预测聚合动作周围的残差,这确保了即使某些源策略表现不佳,目标策略仍具有表达能力。我们通过在六个模拟环境(从经典控制问题到具有挑战性的机器人仿真,涵盖连续与离散动作空间)上的广泛实验评估,证明了 MULTIPOLAR 的有效性。演示视频和代码可在项目网页获取:https://omron-sinicx.github.io/multipolar/。
引用
@article{arxiv.1909.13111,
title = {MULTIPOLAR: Multi-Source Policy Aggregation for Transfer Reinforcement Learning between Diverse Environmental Dynamics},
author = {Mohammadamin Barekatain and Ryo Yonetani and Masashi Hamaya},
journal= {arXiv preprint arXiv:1909.13111},
year = {2020}
}
备注
This work was presented at IJCAI 2020. Copyright (c) 2020 International Joint Conferences on Artificial Intelligence, All rights reserved