中文

迈向模仿学习的基本极限

机器学习 2020-09-15 v1 人工智能 最优化与控制 机器学习

摘要

模仿学习(IL)旨在仅给定演示的情况下,在序贯决策问题中模仿专家策略的行为。本文关注理解分段马尔可夫决策过程(MDPs)中 IL 的极小极大统计极限。我们首先考虑学习者在事前获得 NN 条专家轨迹数据集且无法与 MDP 交互的情形。此处我们表明,尽可能模仿专家的策落在期望上相较于专家价值是 SH2log(N)N\lesssim \frac{|\mathcal{S}| H^2 \log (N)}{N} 次优的,即使专家遵循任意随机策略。此处 S\mathcal{S} 为状态空间,HH 为片段长度。此外,我们建立了 SH2/N\gtrsim |\mathcal{S}| H^2 / N 的次优性下界,其甚至适用于专家被限制为确定性的情形,或学习者被允许在与 MDP 交互 NN 个片段时于访问状态主动查询专家的情形。据我们所知,这是首个在无额外假设下次优性不依赖于动作数量的算法。随后,在转移模型给定且专家为确定性的设定下,我们提出一种基于最小距离泛函的新算法。该算法次优性为 min{HS/N, SH3/2/N}\lesssim \min \{ H \sqrt{|\mathcal{S}| / N} ,\ |\mathcal{S}| H^{3/2} / N \},表明转移知识将极小极大率提升至少 H\sqrt{H} 因子。

关键词

引用

@article{arxiv.2009.05990,
  title  = {Toward the Fundamental Limits of Imitation Learning},
  author = {Nived Rajaraman and Lin F. Yang and Jiantao Jiao and Kannan Ramachandran},
  journal= {arXiv preprint arXiv:2009.05990},
  year   = {2020}
}

备注

45 pages, 3 figures