强化学习中用于零样本迁移的超网络
机器学习
2023-01-04 v2
摘要
本文通过一种新颖的基于TD的训练目标以及来自一组训练任务近最优强化学习解的数据,训练超网络以在一系列未见过的任务条件下生成行为。这项工作涉及元强化学习、情境强化学习和迁移学习,特别关注测试时的零样本性能,这得益于对任务参数(也称为情境)的了解。我们的技术方法基于将每种强化学习算法视为从MDP具体设定到近最优价值函数和策略的映射,并寻求用一个超网络来逼近该映射,该超网络能够在给定MDP参数的情况下生成近最优价值函数和策略。我们证明,在某些条件下,这种映射可以被视为一个有监督学习问题。我们在DeepMind Control Suite的一系列连续控制任务上,实证评估了我们的方法在新奖励和转移动态上的零样本迁移有效性。与多任务和元强化学习方法相比,我们的方法展现出了显著的改进。
引用
@article{arxiv.2211.15457,
title = {Hypernetworks for Zero-shot Transfer in Reinforcement Learning},
author = {Sahand Rezaei-Shoshtari and Charlotte Morissette and Francois Robert Hogan and Gregory Dudek and David Meger},
journal= {arXiv preprint arXiv:2211.15457},
year = {2023}
}
备注
AAAI 2023