中文

TaSIL:泰勒级数模仿学习

机器学习 2023-01-18 v2

摘要

我们提出 Taylor Series Imitation Learning(TaSIL),一种在连续控制场景下对标准行为克隆损失的简单增强。TaSIL 惩罚所学策略与专家策略之间高阶泰勒级数项的偏差。我们证明,满足一种增量输入到状态稳定性\textit{增量输入到状态稳定性}概念的专家易于学习,即在某种意义上,对专家轨迹的小 TaSIL 增强模仿损失可保证所学策略生成轨迹上的小模仿损失。我们给出了 TaSIL 在可实现设定下的样本复杂度界,其随专家示范数 nnO~(1/n)\tilde{\mathcal{O}}(1/n) 缩放。最后,我们通过实验展示了专家策略的鲁棒性与 TaSIL 中所需泰勒展开阶数之间的关系,并将标准 Behavior Cloning、DART 和 DAgger 与 TaSIL 损失增强变体进行比较。在所有情况下,我们在多种 MuJoCo 任务上均显示出相较基线的显著提升。

关键词

引用

@article{arxiv.2205.14812,
  title  = {TaSIL: Taylor Series Imitation Learning},
  author = {Daniel Pfrommer and Thomas T. C. K. Zhang and Stephen Tu and Nikolai Matni},
  journal= {arXiv preprint arXiv:2205.14812},
  year   = {2023}
}

备注

Appeared at NeurIPS 2022. V2: added to related work, updated notation, fixed small errors in appendix