基于 Q 网络表征的异动作空间迁移强化学习
机器学习
2022-04-25 v3 人工智能
摘要
强化学习中的迁移学习方法旨在通过利用在其他智能体上从相似源域中学到的知识,来辅助智能体学习其目标域。例如,该领域近期的研究重点放在具有不同转移动态和奖励函数的任务之间的知识迁移;然而,对于具有不同动作空间的任务之间的知识迁移关注甚少。本文研究动作空间不同的域之间的迁移学习任务。我们提出一种基于源嵌入相似度的奖励塑形方法,适用于具有离散和连续动作空间的域。我们在 Acrobot-v1 和 Pendulum-v0 域中向受限动作空间的迁移上评估了方法的有效性。与两个基线的比较表明,我们的方法在这些连续动作空间中并未优于这些基线,但在这些离散动作空间中确实表现出改进。我们以该工作的未来方向作结分析。
引用
@article{arxiv.2202.02442,
title = {Transfer Reinforcement Learning for Differing Action Spaces via Q-Network Representations},
author = {Nathan Beck and Abhiramon Rajasekharan and Hieu Tran},
journal= {arXiv preprint arXiv:2202.02442},
year = {2022}
}
备注
5 pages, 2 figures, 1 table