中文

用于迁移学习的渐近最优问题相关 Bandit 策略

机器学习 2025-09-24 v1 统计理论 统计理论

摘要

我们研究迁移学习设定下的非上下文多臂 Bandit 问题:在进行任何拉动之前,学习者获得来自每个源分布 νk\nu'_kNkN'_k 个独立同分布样本,且真实目标分布 νk\nu_k 位于已知的距离界限内,即 dk(νk,νk)Lkd_k(\nu_k, \nu'_k) \le L_k。在此框架下,我们首先推导出累积遗憾的问题相关渐近下界,该下界扩展了经典的 Lai-Robbins 结果以纳入迁移参数 (dk,Lk,Nk)(d_k, L_k, N'_k)。然后,我们提出 KL-UCB-Transfer,一种在高斯情形下匹配该新界限的简单索引策略。最后,我们通过仿真验证了该方法,表明当源分布和目标分布足够接近时,KL-UCB-Transfer 显著优于无先验基线。

关键词

引用

@article{arxiv.2509.19098,
  title  = {Asymptotically Optimal Problem-Dependent Bandit Policies for Transfer Learning},
  author = {Adrien Prevost and Timothee Mathieu and Odalric-Ambrym Maillard},
  journal= {arXiv preprint arXiv:2509.19098},
  year   = {2025}
}