在离线到在线学习中平衡乐观与悲观
机器学习
2025-03-11 v2 人工智能
摘要
我们关注一种称为离线到在线学习的设置,聚焦于随机有限臂bandit问题。在离线到在线学习中,学习者开始时使用离线数据与未知环境进行交互,这些数据是以不受学习者控制的方式收集的。基于这些数据,学习者开始与环境交互,逐步改进其初始策略以最大化总奖励。在这种设置下,学习者面临一个根本性困境:如果策略只部署短时间,合适的策略是基于乐观主义的下置置信界(LCB)算法;LCB能够有效地与任何被离线数据充分“覆盖”的策略竞争。然而,对于更长的时间范围,更受青睐的策略是基于悲观主义的上置置信界(UCB)算法。UCB随时间逼近最优策略的收敛率几乎是所有在线算法中最好的。然而,在离线到在线学习中,UCB最初会过度探索,导致其在短期内表现不如LCB。这表明,对于其政策使用时间不受控制的学习者,应在短期内使用LCB,然后逐渐过渡到类似UCB的策略。本文探讨了这种过渡应如何发生以及为何发生。我们的主要结果表明,新的算法在任何时点都能几乎与LCB和UCB中更好的一个相当。我们算法的核心思想具有更广泛的适用性,我们预计这些结果将扩展到多臂bandit设置之外。
引用
@article{arxiv.2502.08259,
title = {Balancing optimism and pessimism in offline-to-online learning},
author = {Flore Sentenac and Ilbin Lee and Csaba Szepesvari},
journal= {arXiv preprint arXiv:2502.08259},
year = {2025}
}