深度模仿学习的务实考察
机器学习
2023-09-21 v2 神经与进化计算
机器学习
摘要
生成对抗模仿学习(GAIL)算法的提出促进了使用深度神经网络的可扩展模仿学习方法的发展。其后许多算法采用了类似流程,将 on-policy actor-critic 算法与逆强化学习相结合。近来出现了更广泛的方法,其中大多数使用 off-policy 算法。然而,随着算法种类增多,从数据集到基础强化学习算法再到评估设置皆可能不同,难以公平比较。本工作中我们重新实现了 6 种不同的 IL 算法,将其中 3 种更新为 off-policy,以通用的 off-policy 算法(SAC)为基础,并在广泛使用的专家轨迹数据集(D4RL)上针对最常见的基准(MuJoCo)进行评估。在给予所有算法相同超参数优化预算后,我们比较了它们在一系列专家轨迹下的结果。总之,GAIL 及其所有改进在一系列样本量下始终表现良好,AdRIL 是一个简单的竞争者,在有一个重要超参数需调优时表现良好,而当数据更充足时行为克隆仍是一个强基线。
引用
@article{arxiv.2108.01867,
title = {A Pragmatic Look at Deep Imitation Learning},
author = {Kai Arulkumaran and Dan Ogawa Lillrank},
journal= {arXiv preprint arXiv:2108.01867},
year = {2023}
}
备注
Asian Conference on Machine Learning, 2023