一种基于观测映射与行为克隆的小样本策略迁移框架
机器人学
2023-10-16 v1 人工智能
机器学习
摘要
尽管强化学习在机器人应用中取得了近期进展,许多任务仍因昂贵的交互代价而难以求解。迁移学习通过迁移源域中学到的知识,减少目标域的训练时间。Sim2Real 迁移有助于将知识从模拟机器人域迁移到物理目标域。知识迁移减少了在交互代价高昂的物理世界中训练任务所需的时间。然而,大多数现有方法假设两个域在任务结构和物理属性上精确对应。本工作提出一种通过观测映射与行为克隆实现两域间小样本策略迁移的框架。我们使用生成对抗网络(GAN)配合循环一致性损失来映射源域与目标域之间的观测,随后利用该学到的映射将成功的源任务行为策略克隆到目标域。我们观察到在目标任务交互有限且源任务与目标任务语义不相似的情况下,仍实现了成功的行为策略迁移。
引用
@article{arxiv.2310.08836,
title = {A Framework for Few-Shot Policy Transfer through Observation Mapping and Behavior Cloning},
author = {Yash Shukla and Bharat Kesari and Shivam Goel and Robert Wright and Jivko Sinapov},
journal= {arXiv preprint arXiv:2310.08836},
year = {2023}
}
备注
Paper accepted to the IROS 2023 Conference