中文

Lipschitz 连续性是驯服离策略生成对抗模仿学习所需的全部条件

机器学习 2023-10-26 v4 人工智能

摘要

尽管强化学习近期在各个领域取得成功,这些方法在很大程度上仍令人望而却步地敏感于超参数,并且常常依赖于使其成功所必需的关键工程技巧。我们考虑离策略生成对抗模仿学习的情况,并对该方法进行定性与定量的深入审视。我们表明,强制所学奖励函数具有局部 Lipschitz 连续性是该方法的性能良好的必要条件。随后我们研究这一必要条件的影响,并给出若干涉及状态值函数局部 Lipschitz 性的理论结果。我们以经验证据补充这些保证,证实在奖励上持续满足 Lipschitz 约束对模仿性能具有强烈的积极效果。最后,我们提出一种通用的悲观奖励预处理附加模块,由此衍生出一大类奖励塑形方法,正如若干额外理论保证所示,其使所插入的基础方法在可证明意义上更为鲁棒。我们随后以细粒度视角讨论这些,并分享我们的见解。关键在于,本工作中推导与报告的保证对任意满足 Lipschitz 条件的奖励均成立,并无任何内容专属于模仿。因此,这些保证可能具有独立意义。

关键词

引用

@article{arxiv.2006.16785,
  title  = {Lipschitzness Is All You Need To Tame Off-policy Generative Adversarial Imitation Learning},
  author = {Lionel Blondé and Pablo Strasser and Alexandros Kalousis},
  journal= {arXiv preprint arXiv:2006.16785},
  year   = {2023}
}

备注

Accepted for publication in Machine Learning 2022