基于分类的高效在线模仿学习
机器学习
2022-09-27 v1
摘要
模仿学习(IL)是一种用于解决序列决策问题的通用学习范式。交互式模仿学习允许学习器交互式地查询专家演示,已被证明相比离线模仿学习或强化学习具有可证明更优的样本效率保证。在本工作中,我们研究基于分类的在线模仿学习(简称 )以及在此设定下设计预言机高效遗憾最小化算法的基本可行性,重点关注一般不可实现情形。我们做出如下贡献:(1)我们证明在 问题中,任何恰当在线学习算法一般无法保证次线性遗憾;(2)我们提出 ,一种非恰当在线学习算法框架,通过利用混合策略类的新定义,将 归约为在线线性优化;(3)我们在 框架内设计两种预言机高效算法,享有不同的样本与交互轮数复杂度权衡,并做有限样本分析以展示其相对朴素行为克隆的改进;(4)我们证明在标准复杂性理论假设下, 框架中的高效动态遗憾最小化是不可行的。我们的工作将基于分类的在线模仿学习这一重要 IL 设定置于更坚实的基础上。
引用
@article{arxiv.2209.12868,
title = {On Efficient Online Imitation Learning via Classification},
author = {Yichen Li and Chicheng Zhang},
journal= {arXiv preprint arXiv:2209.12868},
year = {2022}
}
备注
51 pages, 2 figures, 36th Conference on Neural Information Processing Systems (NeurIPS 2022)