持续强化学习中的迁移解耦
机器学习
2022-09-29 v1
摘要
持续学习系统从已见任务迁移知识以最大化新任务性能的能力是该领域的一项重大挑战,限制了持续学习方案在现实场景中的适用性。因此,本研究旨在拓宽我们对持续强化学习这一特定情形下迁移及其驱动因素的理解。我们采用 SAC 作为底层 RL 算法,并采用 Continual World 作为连续控制任务套件。我们系统地研究了 SAC 的不同组件(actor 与 critic、探索以及数据)如何影响迁移效能,并就各种建模选择提供了建议。被称为 ClonEx-SAC 的最佳选择集在最近的 Continual World 基准上进行了评估。ClonEx-SAC 实现了 87% 的最终成功率,而基准中最佳方法 PackNet 为 80%。此外,根据 Continual World 提供的指标,迁移从 0.18 增长到 0.54。
引用
@article{arxiv.2209.13900,
title = {Disentangling Transfer in Continual Reinforcement Learning},
author = {Maciej Wołczyk and Michał Zając and Razvan Pascanu and Łukasz Kuciński and Piotr Miłoś},
journal= {arXiv preprint arXiv:2209.13900},
year = {2022}
}
备注
Accepted at NeurIPS 2022