基于在线回归的选择性采样与模仿学习
机器学习
2023-07-12 v1 人工智能
统计理论
机器学习
统计理论
摘要
我们考虑通过主动查询带噪声专家反馈来进行模仿学习(IL)的问题。尽管模仿学习在经验上取得了成功,但先前的许多工作都假设能获取无噪声的专家反馈,这在实际应用中并不现实。事实上,当只能获取带噪声的专家反馈时,依赖纯离线数据(非交互式 IL)的算法可被证明需要极其大量的样本才能成功。相比之下,本工作提供了一种用于 IL 的交互式算法,其使用选择性采样来主动查询带噪声专家以获取反馈。我们的贡献有两点:首先,我们提供了一种新的选择性采样算法,适用于一般函数类和多动作情形,并获得了关于后悔值和查询次数的已知最优界。接着,我们将该分析扩展到带噪声专家反馈的 IL 问题,并提供了一种查询次数有限的新 IL 算法。我们的选择性采样算法利用函数逼近,并依赖于针对给定模型类的在线回归预言机来预测动作,以及决定是否向专家查询其标签。在理论方面,我们算法的后悔值上界由在线回归预言机的后悔值界定,而查询复杂度还取决于模型类的 eluder 维数。我们辅以一个下界,表明我们的结果是紧的。我们将选择性采样算法扩展至带一般函数逼近的 IL,并给出了向带噪声专家所提查询的后悔值与次数的界。此处的一个关键新颖之处在于,我们的后悔值和查询复杂度界仅依赖于最优策略(而非噪声专家或学习器)进入具有小间隔状态的次数。
引用
@article{arxiv.2307.04998,
title = {Selective Sampling and Imitation Learning via Online Regression},
author = {Ayush Sekhari and Karthik Sridharan and Wen Sun and Runzhe Wu},
journal= {arXiv preprint arXiv:2307.04998},
year = {2023}
}