中文

利用示范数据改进在线学习:质量至关重要

机器学习 2023-05-18 v4 统计理论 机器学习 统计理论

摘要

我们研究了离线示范数据能在多大程度上改进在线学习。自然地预期会有一些改进,但问题是如何改进以及改进多少?我们表明,改进的程度必须取决于示范数据的质量。为了产生具有普适性的见解,我们将应用于多臂赌博机的 Thompson 采样 (TS) 作为原型在线学习算法和模型进行关注。示范数据由具有给定能力水平的专家生成,这是我们引入的一个概念。我们提出了一种知情 TS 算法,通过贝叶斯规则连贯地利用示范数据,并推导出依赖于先验的贝叶斯遗憾界。这提供了关于预训练如何极大改善在线性能,以及改进程度如何随专家能力水平增加而提高的见解。我们还通过贝叶斯自助法开发了一种实用的近似知情 TS 算法,并通过实验展示了实质性的经验遗憾减少。

关键词

引用

@article{arxiv.2302.03319,
  title  = {Leveraging Demonstrations to Improve Online Learning: Quality Matters},
  author = {Botao Hao and Rahul Jain and Tor Lattimore and Benjamin Van Roy and Zheng Wen},
  journal= {arXiv preprint arXiv:2302.03319},
  year   = {2023}
}

备注

Accepted at ICML 2023