中文

深度模仿学习的务实考察

机器学习 2023-09-21 v2 神经与进化计算 机器学习

摘要

生成对抗模仿学习(GAIL)算法的提出促进了使用深度神经网络的可扩展模仿学习方法的发展。其后许多算法采用了类似流程,将 on-policy actor-critic 算法与逆强化学习相结合。近来出现了更广泛的方法,其中大多数使用 off-policy 算法。然而,随着算法种类增多,从数据集到基础强化学习算法再到评估设置皆可能不同,难以公平比较。本工作中我们重新实现了 6 种不同的 IL 算法,将其中 3 种更新为 off-policy,以通用的 off-policy 算法(SAC)为基础,并在广泛使用的专家轨迹数据集(D4RL)上针对最常见的基准(MuJoCo)进行评估。在给予所有算法相同超参数优化预算后,我们比较了它们在一系列专家轨迹下的结果。总之,GAIL 及其所有改进在一系列样本量下始终表现良好,AdRIL 是一个简单的竞争者,在有一个重要超参数需调优时表现良好,而当数据更充足时行为克隆仍是一个强基线。

关键词

引用

@article{arxiv.2108.01867,
  title  = {A Pragmatic Look at Deep Imitation Learning},
  author = {Kai Arulkumaran and Dan Ogawa Lillrank},
  journal= {arXiv preprint arXiv:2108.01867},
  year   = {2023}
}

备注

Asian Conference on Machine Learning, 2023