中文

连续零均值分歧正则化模仿学习 (CMZ-DRIL)

机器学习 2024-03-05 v1

摘要

模仿学习和强化学习等机器学习范式能够在各种复杂环境中生成高性能的智能体。然而,常用的方法需要大量数据和/或已知的奖励函数。本文提出了一种名为连续零均值分歧正则化模仿学习 (CMZ-DRIL) 的方法,该方法采用一种新颖的奖励结构来提高仅能获取少量专家演示的模仿学习智能体的性能。CMZ-DRIL 使用强化学习来最小化经过训练以对专家演示进行建模的智能体集合中的不确定性。该方法不使用任何特定于环境的奖励,而是根据智能体集合的动作分歧创建连续的零均值奖励函数。如在航点导航环境和两个 MuJoCo 环境中所展示的,CMZ-DRIL 能够生成高性能的智能体,其在几项关键指标上的行为比先前的主要方法更类似于专家。

关键词

引用

@article{arxiv.2403.01059,
  title  = {Continuous Mean-Zero Disagreement-Regularized Imitation Learning (CMZ-DRIL)},
  author = {Noah Ford and Ryan W. Gardner and Austin Juhl and Nathan Larson},
  journal= {arXiv preprint arXiv:2403.01059},
  year   = {2024}
}