利用示范数据改进在线学习:质量至关重要
机器学习
2023-05-18 v4 统计理论
机器学习
统计理论
摘要
我们研究了离线示范数据能在多大程度上改进在线学习。自然地预期会有一些改进,但问题是如何改进以及改进多少?我们表明,改进的程度必须取决于示范数据的质量。为了产生具有普适性的见解,我们将应用于多臂赌博机的 Thompson 采样 (TS) 作为原型在线学习算法和模型进行关注。示范数据由具有给定能力水平的专家生成,这是我们引入的一个概念。我们提出了一种知情 TS 算法,通过贝叶斯规则连贯地利用示范数据,并推导出依赖于先验的贝叶斯遗憾界。这提供了关于预训练如何极大改善在线性能,以及改进程度如何随专家能力水平增加而提高的见解。我们还通过贝叶斯自助法开发了一种实用的近似知情 TS 算法,并通过实验展示了实质性的经验遗憾减少。
关键词
引用
@article{arxiv.2302.03319,
title = {Leveraging Demonstrations to Improve Online Learning: Quality Matters},
author = {Botao Hao and Rahul Jain and Tor Lattimore and Benjamin Van Roy and Zheng Wen},
journal= {arXiv preprint arXiv:2302.03319},
year = {2023}
}
备注
Accepted at ICML 2023