互模拟在目标条件强化学习中构建类比
机器学习
2022-05-18 v3
摘要
从丰富观测中构建可泛化的目标条件智能体是强化学习(RL)解决现实世界问题的关键。传统上,在目标条件RL中,智能体会被提供其意图到达的确切目标。然而,在执行任务前知道目标的配置通常是不现实的。一个更具可扩展性的框架将允许我们向智能体提供一个类比任务的示例,然后让智能体推断其当前状态的目标应该是什么。我们提出了一种称为目标条件互模拟的状态抽象新形式,它捕捉了功能等变性,允许复用技能以实现新目标。我们使用该抽象的度量形式学习这一表示,并展示了其在模拟操作任务中泛化到新目标的能力。此外,我们证明了这种学习到的表示不仅足以用于目标条件任务,而且适用于由仅状态奖励函数描述的任何下游任务。视频可在 https://sites.google.com/view/gc-bisimulation 找到。
引用
@article{arxiv.2204.13060,
title = {Bisimulation Makes Analogies in Goal-Conditioned Reinforcement Learning},
author = {Philippe Hansen-Estruch and Amy Zhang and Ashvin Nair and Patrick Yin and Sergey Levine},
journal= {arXiv preprint arXiv:2204.13060},
year = {2022}
}
备注
ICML 2022. 20 Pages, 15 Figures, 4 Tables. Website at https://sites.google.com/view/gc-bisimulation