中文

Sample-mean anchored Thompson sampling for offline-to-online learning with distribution shift

机器学习 2026-05-15 v2 机器学习

摘要

offline-to-online学习旨在通过利用offline logged数据来提高online决策。在此setting中,offline和online环境之间的distribution shift是一个核心挑战。虽然一些现有工作试图利用偏移的offline数据,但它们大多依赖于UCB-type算法。Thompson抽样(TS)代表另一类bandit算法,因其强大的实证性能以及其通过Bayesian formulation天然适合offline-to-online学习而著称。然而,与UCB index不同,TS中的后验样本不保证对true arm均值持积极态。 这使得construct从纯online和混合数据构建的index难以比较,妨碍了其使用。为此,我们提出sample-mean anchored TS(Anchor-TS),其引入一种基于median的anchoring规则,将arm index定义为online后验样本、混合后验样本和online sample mean的median。median anchoring通过缓解次优arm的over-estimation和优秀arm的under-estimation,系统性地校正由distribution shift引起的bias,同时利用offline信息在shift较小时获得更准确的估计。我们建立了理论保证,表明所提出的算法安全地利用offline数据加速online学习,并量化了distribution shift的程度和offline数据大小如何影响 resulting regret reduction。大量实验表明,我们的算法在基准方法上 consistently实现改进。

关键词

引用

@article{arxiv.2605.10289,
  title  = {Sample-Mean Anchored Thompson Sampling for Offline-to-Online Learning with Distribution Shift},
  author = {Bochao Li and Yao Fu and Wei Chen and Fang Kong},
  journal= {arXiv preprint arXiv:2605.10289},
  year   = {2026}
}