中文

模仿约束下的离线多样性最大化

机器学习 2024-06-24 v3 人工智能 机器人学

摘要

在无监督技能发现领域近期取得了显著进展,利用各种信息论目标作为多样性的度量。尽管有这些进展,挑战依然存在:当前方法需要大量在线交互,未能利用海量可用的任务无关数据,且通常缺乏对技能效用的定量度量。我们通过提出一种原则性的离线无监督技能发现算法来应对这些挑战,该算法在最大化多样性的同时,确保每个所学技能在一定程度上模仿仅状态专家示范。我们分析上的主要贡献是将 Fenchel 对偶、强化学习与无监督技能发现相联系,以在 KL 散度状态占据约束下最大化互信息目标。此外,我们在标准离线基准 D4RL 以及从 12 自由度四足机器人收集的定制离线数据集上展示了我们方法的有效性,其中在仿真中训练的策略可良好迁移至真实机器人系统。

关键词

引用

@article{arxiv.2307.11373,
  title  = {Offline Diversity Maximization Under Imitation Constraints},
  author = {Marin Vlastelica and Jin Cheng and Georg Martius and Pavel Kolev},
  journal= {arXiv preprint arXiv:2307.11373},
  year   = {2024}
}

备注

RLC 2024