RAIL:一种基于强化学习的对抗模仿学习的模块化框架
机器学习
2022-02-15 v1
摘要
尽管对抗模仿学习(AIL)算法近期在各种模仿学习基准上取得了最先进的结果,但尚不清楚各种设计决策对性能有何影响。为此,我们在此提出一个称为基于强化学习的对抗模仿学习(RAIL)的组织化模块化框架,它涵盖并推广了一类流行的现有 AIL 方法。借助 RAIL 所倡导的视角,我们创建了两种新的 IfO(从观测模仿,Imitation from Observation)算法,称之为 SAIfO:基于 SAC 的从观测对抗模仿,以及 SILEM(用于具身差异的模仿学习的骨骼特征补偿,Skeletal Feature Compensation for Imitation Learning with Embodiment Mismatch)。我们在另一份技术报告中更详细地介绍了 SILEM。在本文中,我们聚焦于 SAIfO,在 OpenAI Gym 的一组运动任务上对其进行评估,并表明其优于同期执行 IfO 的 RAIL 算法。
引用
@article{arxiv.2105.03756,
title = {RAIL: A modular framework for Reinforcement-learning-based Adversarial Imitation Learning},
author = {Eddy Hudson and Garrett Warnell and Peter Stone},
journal= {arXiv preprint arXiv:2105.03756},
year = {2022}
}
备注
arXiv admin note: text overlap with arXiv:2104.07810