中文

基于聚合数据的对抗模仿学习

机器学习 2023-11-16 v1 人工智能

摘要

逆强化学习(IRL)在给定一些专家示范的情况下学习最优策略,从而避免了指定合适奖励函数这一繁琐过程。然而,现有方法至少受限于以下需求之一。其一是需要在算法内循环中完全求解一个前向强化学习(RL)问题,这在许多复杂环境中可能代价过高。其二是需要来自专家的完整轨迹,而这未必容易获取。其三是假设专家数据是同质的,而非来自不同专家或同一任务多种可能解的汇集。此类约束使得 IRL 方法要么不可扩展,要么在某些现有系统上无法使用。本工作中,我们提出一种通过称为基于聚合数据的对抗模仿学习(AILAD)的动态自适应方法消除这些需求的方法。它利用对抗框架联合学习非线性奖励函数及相应最优策略。奖励学习器仅使用聚合数据。此外,它生成多样化行为,产生匹配专家在聚合数据上分布的策略分布。

关键词

引用

@article{arxiv.2311.08568,
  title  = {Adversarial Imitation Learning On Aggregated Data},
  author = {Pierre Le Pelletier de Woillemont and Rémi Labory and Vincent Corruble},
  journal= {arXiv preprint arXiv:2311.08568},
  year   = {2023}
}