一种基于优势的策略迁移算法用于带可迁移性度量的强化学习
机器学习
2024-12-17 v2 人工智能
摘要
强化学习(RL)通过与环境的互动,在复杂高维环境中实现序贯决策。然而,在大多数现实应用中,大量交互是不可行的。在这些环境中,迁移强化学习算法可用于将一个或多个源环境的知识迁移到目标环境,已被证明能够提高学习速度并改善初始与渐近性能。然而,现有大多数迁移强化学习算法为同策略且采样效率低,在对抗性目标任务中失效,且常在算法设计中需要启发式选择。本文提出一种离策略的基于优势的策略迁移算法 APT-RL,用于固定领域环境。其新颖之处在于使用流行的“优势”概念作为正则化项,权衡应从源环境迁移的知识与目标环境中学习到的新知识,从而免除了启发式选择的需要。进一步,我们提出一种新的迁移性能度量来评估算法性能并统一现有迁移强化学习框架。最后,我们提出一种可扩展的、有理论支撑的任务相似性度量算法,以阐明所提出的可迁移性度量与源和目标环境之间相似性的对应关系。我们在三个高维连续控制任务中将 APT-RL 与若干基线(包括现有迁移强化学习算法)进行比较。实验表明 APT-RL 优于现有迁移强化学习算法,且在对抗性任务中至少与从零开始学习一样好。
引用
@article{arxiv.2311.06731,
title = {An advantage based policy transfer algorithm for reinforcement learning with measures of transferability},
author = {Md Ferdous Alam and Parinaz Naghizadeh and David Hoelzle},
journal= {arXiv preprint arXiv:2311.06731},
year = {2024}
}
备注
12 pages, 5 figures