迈向模仿学习的基本极限
机器学习
2020-09-15 v1 人工智能
最优化与控制
机器学习
摘要
模仿学习(IL)旨在仅给定演示的情况下,在序贯决策问题中模仿专家策略的行为。本文关注理解分段马尔可夫决策过程(MDPs)中 IL 的极小极大统计极限。我们首先考虑学习者在事前获得 条专家轨迹数据集且无法与 MDP 交互的情形。此处我们表明,尽可能模仿专家的策落在期望上相较于专家价值是 次优的,即使专家遵循任意随机策略。此处 为状态空间, 为片段长度。此外,我们建立了 的次优性下界,其甚至适用于专家被限制为确定性的情形,或学习者被允许在与 MDP 交互 个片段时于访问状态主动查询专家的情形。据我们所知,这是首个在无额外假设下次优性不依赖于动作数量的算法。随后,在转移模型给定且专家为确定性的设定下,我们提出一种基于最小距离泛函的新算法。该算法次优性为 ,表明转移知识将极小极大率提升至少 因子。
引用
@article{arxiv.2009.05990,
title = {Toward the Fundamental Limits of Imitation Learning},
author = {Nived Rajaraman and Lin F. Yang and Jiantao Jiao and Kannan Ramachandran},
journal= {arXiv preprint arXiv:2009.05990},
year = {2020}
}
备注
45 pages, 3 figures