中文

线性情境多臂盒子中的离线到在线方向感知学习

机器学习 2026-05-08 v2

摘要

许多 bandit 系统部署时会使用离线历史数据,例如来自早期策略的日志。利用这些数据可以在它们对在线问题仍保持信息性时,减少早期在线探索的需求。当离线和在线环境不同时,这些数据对在线问题可能具有偏差。对于线性 (情境) bandits,此偏差是方向性的:离线数据在某些特征方向上可能具有信息性,在其他特征方向上则可能误导。然而,先前的工作通常通过对模型参数的已知欧几里得边界来控制这一差距,我们证明了这种方法过于粗糙:即使已知离线参数,偏差在单个未知方向上也会导致维度相关的 regret。为此,我们提出一种称为 MbiasM_{\mathrm{bias}}-induced norm 的方向偏差证书 (Mbias,ρ)(M_{\mathrm{bias}},\rho),通过 MbiasM_{\mathrm{bias}}-induced norm 测量离线-在线差距,并为不同方向分配不同的偏差预算。基于该证书,我们提出 Ellipsoidal-MINUCB 算法,通过离线-池化分支来安全地利用历史数据。当证书已知时,我们证明该算法在最坏情况下匹配标准 SupLinUCB 收敛率,并在离线覆盖与低偏差方向一致时实现改进。当证书未知时,我们从离线数据和累积的在线数据中自适应估计该证书,并给出相应的 regret 保证。数值实验支持理论结果,表明在对齐 regime 中可实现收益。

关键词

引用

@article{arxiv.2604.24016,
  title  = {Direction-Aware Offline-to-Online Learning in Linear Contextual Bandits},
  author = {Zean Han and Ruihan Lin and Zezhen Ding and Jiheng Zhang},
  journal= {arXiv preprint arXiv:2604.24016},
  year   = {2026}
}