DisCo RL:面向通用策略的分布条件强化学习
机器学习
2021-04-26 v1 人工智能
机器人学
摘要
我们能否使用强化学习来学习可执行广泛不同任务的通用策略,从而产生灵活且可复用的技能?上下文策略在原理上提供了这一能力,但上下文的表示方式决定了泛化程度和表达能力。类别型上下文排除了对全新任务的泛化。目标条件策略可能实现一定泛化,但无法涵盖所有可能被期望的任务。本文中,我们提出以目标分布作为适用于上下文策略的通用且广泛适用的任务表示。目标分布在配备合适的分布类时可表示任意基于状态的奖励函数,因而具有通用性;而分布类的特定选择使我们能够在表达能力和可学习性之间进行权衡。我们开发了一种称为分布条件强化学习(DisCo RL)的离策略算法,以高效学习这些策略。我们在多种机器人操作任务上评估了 DisCo RL,发现其在需要泛化到新目标分布的任务上显著优于先前方法。
引用
@article{arxiv.2104.11707,
title = {DisCo RL: Distribution-Conditioned Reinforcement Learning for General-Purpose Policies},
author = {Soroush Nasiriany and Vitchyr H. Pong and Ashvin Nair and Alexander Khazatsky and Glen Berseth and Sergey Levine},
journal= {arXiv preprint arXiv:2104.11707},
year = {2021}
}
备注
ICRA 2021