用于迁移学习的渐近最优问题相关 Bandit 策略
机器学习
2025-09-24 v1 统计理论
统计理论
摘要
我们研究迁移学习设定下的非上下文多臂 Bandit 问题:在进行任何拉动之前,学习者获得来自每个源分布 的 个独立同分布样本,且真实目标分布 位于已知的距离界限内,即 。在此框架下,我们首先推导出累积遗憾的问题相关渐近下界,该下界扩展了经典的 Lai-Robbins 结果以纳入迁移参数 。然后,我们提出 KL-UCB-Transfer,一种在高斯情形下匹配该新界限的简单索引策略。最后,我们通过仿真验证了该方法,表明当源分布和目标分布足够接近时,KL-UCB-Transfer 显著优于无先验基线。
引用
@article{arxiv.2509.19098,
title = {Asymptotically Optimal Problem-Dependent Bandit Policies for Transfer Learning},
author = {Adrien Prevost and Timothee Mathieu and Odalric-Ambrym Maillard},
journal= {arXiv preprint arXiv:2509.19098},
year = {2025}
}