中文

面向参数化专家高效学习的数据增强方法

机器学习 2022-05-24 v1 人工智能

摘要

我们提出了一种简单而强大的数据增强技术,以实现从参数化专家进行数据高效学习的强化与模仿学习。我们关注所谓的策略克隆设定,其中我们利用对专家或专家策略的在线或离线查询来指导学生策略的行为。该设定自然出现在若干问题中,例如作为行为克隆的变体,或作为其他算法(如 DAGGER、策略蒸馏或 KL 正则化 RL)的组成部分。我们的方法——增强策略克隆(APC)——利用合成状态在采样轨迹周围的区域中诱导反馈敏感性,从而大幅减少成功克隆专家所需的环境交互。我们针对高自由度控制问题实现了从专家到学生策略的极具数据效率的行为迁移。我们在若干将策略克隆作为构成部分的现有且广泛使用的算法背景下展示了本方法的益处。此外,我们在两个实际相关设定中凸显了本方法的优势:(a)专家压缩,即迁移到参数更少的学生;(b)来自特权专家的迁移,即专家具有与学生不同的观测空间,通常包含对特权信息的访问。

关键词

引用

@article{arxiv.2205.11448,
  title  = {Data augmentation for efficient learning from parametric experts},
  author = {Alexandre Galashov and Josh Merel and Nicolas Heess},
  journal= {arXiv preprint arXiv:2205.11448},
  year   = {2022}
}