基于回顾式探索与习得世界模型的多任务适配
机器学习
2021-10-27 v1
摘要
基于模型的强化学习(MBRL)能够以样本高效的方式解决复杂任务。然而,任务之间的信息并未被复用。在本工作中,我们提出了一种称为 RAMa 的元学习寻址模型,该模型为 MBRL 智能体提供来自持续增长的任务无关存储库的培训样本。该模型通过从存储库中选取解决先前任务的有前景轨迹进行训练,以最大化智能体的期望性能。我们表明,这种回顾式探索能够通过更好地告知习得动力学并以探索性轨迹提示智能体来加速 MBRL 智能体的学习过程。我们在 DeepMind control suite、Metaworld 多任务基准以及我们使用 NVIDIA Isaac 机器人模拟器实现的定制环境中测试了我们的方法性能,以检验模型在照片级真实、光线追踪环境中行动的能力。
引用
@article{arxiv.2110.13241,
title = {Multitask Adaptation by Retrospective Exploration with Learned World Models},
author = {Artem Zholus and Aleksandr I. Panov},
journal= {arXiv preprint arXiv:2110.13241},
year = {2021}
}