中文

随机赌博机的离线到在线超参数迁移

机器学习 2025-01-07 v1

摘要

随机赌博机的经典算法通常使用超参数来控制其关键属性,例如探索与利用之间的权衡。调整这些超参数是一个具有重大实际意义的问题。然而,这是一个具有挑战性的问题,在某些情况下在信息论上是不可能的。为了解决这一挑战,我们考虑了一个实际相关的迁移学习设置,其中我们可以访问从多个赌博机问题(任务)收集的离线数据,这些任务来自一个未知的任务分布。我们的目标是利用这些离线数据为从该未知分布中抽取的新任务设置超参数。我们提供了任务间(任务数量)和任务内(每个任务的手臂拉动次数)样本复杂度的界,以学习来自该分布的未见任务上的接近最优超参数。我们的结果适用于几种经典算法,包括调整UCB和LinUCB中的探索参数以及GP-UCB中的噪声参数。我们的实验表明了在具有随机赌博机反馈的在线学习中从离线问题迁移超参数的重要性和有效性。

关键词

引用

@article{arxiv.2501.02926,
  title  = {Offline-to-online hyperparameter transfer for stochastic bandits},
  author = {Dravyansh Sharma and Arun Sai Suggala},
  journal= {arXiv preprint arXiv:2501.02926},
  year   = {2025}
}

备注

AAAI 2025