中文

基于对比傅里叶特征的可证明表示学习模仿

机器学习 2021-10-11 v2 人工智能

摘要

在模仿学习中,通常通过在对收集的目标演示集上进行最大似然训练,来学习匹配未知目标策略的行为策略。本工作中,我们考虑利用离线经验数据集——可能远离目标分布——来学习低维状态表示,可证明地加速下游模仿学习的样本效率。此设置的核心挑战是未知目标策略本身可能不展现低维行为,因此表示学习目标有可能混淆目标策略行为不同的状态。为规避该挑战,我们推导了一个表示学习目标,其对目标策略与通过最大似然训练的低维策略间的性能差异提供上界,且该界无论目标策略本身是否展现低维结构都是紧的。转向我们方法的实用性,我们表明该目标可实现为对比学习,其中转移动态由隐式基于能量的模型近似,或在某些特殊情况下由以随机傅里叶特征为表示的隐式线性模型近似。在表格环境和高维 Atari 游戏上的实验为我们所提目标的实用益处提供了定量证据。

关键词

引用

@article{arxiv.2105.12272,
  title  = {Provable Representation Learning for Imitation with Contrastive Fourier Features},
  author = {Ofir Nachum and Mengjiao Yang},
  journal= {arXiv preprint arXiv:2105.12272},
  year   = {2021}
}