中文

面向上下文多臂老虎机的迁移学习

机器学习 2024-01-26 v2 机器学习 统计理论 统计理论

摘要

受一系列应用驱动,本文研究协变量偏移模型下非参数上下文多臂老虎机的迁移学习问题,其中在目标老虎机学习开始前已收集到源老虎机上的数据。我们建立了累积遗憾的最小最大收敛速率,并提出了一种达到最小最大遗憾的新型迁移学习算法。结果量化了源域数据对在非参数上下文多臂老虎机背景下目标域学习的贡献。鉴于对未知平滑性进行自适应的一般不可能性,我们开发了一种数据驱动算法,在额外的自相似假设下,可在一大类参数空间上自动适应未知参数,同时实现近最优的统计保证(相差一个对数因子)。我们开展了仿真研究以阐明利用辅助源域数据用于目标域学习的益处。

关键词

引用

@article{arxiv.2211.12612,
  title  = {Transfer Learning for Contextual Multi-armed Bandits},
  author = {Changxiao Cai and T. Tony Cai and Hongzhe Li},
  journal= {arXiv preprint arXiv:2211.12612},
  year   = {2024}
}

备注

Accepted to the Annals of Statistics