基于解耦任务表示的元强化学习零样本策略迁移
机器人学
2022-10-04 v1 机器学习
摘要
人类能够将各种任务抽象为多个属性的不同组合。这种组合性视角对于人类的快速学习与适应至关重要,因为来自相关任务的以往经验可被组合以泛化到新颖的组合情境。在本工作中,我们旨在通过利用任务组合性实现强化学习(RL)智能体的零样本策略泛化。我们提出的方法是一种带有解耦任务表示的元强化学习(meta-RL)算法,显式编码任务的不同方面。随后通过所获得的解耦推断未见的组合任务表示,无需额外探索即可完成策略泛化。评估在三个模拟任务及一个具有挑战性的真实世界机器人插入任务上进行。实验结果表明,我们提出的方法以零样本方式实现了对未见组合任务的策略泛化。
引用
@article{arxiv.2210.00350,
title = {Zero-Shot Policy Transfer with Disentangled Task Representation of Meta-Reinforcement Learning},
author = {Zheng Wu and Yichen Xie and Wenzhao Lian and Changhao Wang and Yanjiang Guo and Jianyu Chen and Stefan Schaal and Masayoshi Tomizuka},
journal= {arXiv preprint arXiv:2210.00350},
year = {2022}
}
备注
7 pages, 9 figures