TaSIL:泰勒级数模仿学习
机器学习
2023-01-18 v2
摘要
我们提出 Taylor Series Imitation Learning(TaSIL),一种在连续控制场景下对标准行为克隆损失的简单增强。TaSIL 惩罚所学策略与专家策略之间高阶泰勒级数项的偏差。我们证明,满足一种概念的专家易于学习,即在某种意义上,对专家轨迹的小 TaSIL 增强模仿损失可保证所学策略生成轨迹上的小模仿损失。我们给出了 TaSIL 在可实现设定下的样本复杂度界,其随专家示范数 以 缩放。最后,我们通过实验展示了专家策略的鲁棒性与 TaSIL 中所需泰勒展开阶数之间的关系,并将标准 Behavior Cloning、DART 和 DAgger 与 TaSIL 损失增强变体进行比较。在所有情况下,我们在多种 MuJoCo 任务上均显示出相较基线的显著提升。
引用
@article{arxiv.2205.14812,
title = {TaSIL: Taylor Series Imitation Learning},
author = {Daniel Pfrommer and Thomas T. C. K. Zhang and Stephen Tu and Nikolai Matni},
journal= {arXiv preprint arXiv:2205.14812},
year = {2023}
}
备注
Appeared at NeurIPS 2022. V2: added to related work, updated notation, fixed small errors in appendix