中文

全情境下离线-Oracle 高效的上下文型多臂赌博机统一框架

机器学习 2026-02-11 v1 机器学习

摘要

我们提出一种算法框架 Offline Estimation to Decisions (OE2D),将具有一般奖励函数近似的上下文型多臂赌博机学习问题简化为离线回归。该框架允许在 TT 轮中对上下文型多臂赌博机实现近最优 regret,且只需 O(log(T))O(log(T)) 次调用离线回归 oracle,当 TT 已知时可降低至 O(loglog(T))O(loglog(T))。OE2D 算法的设计概括了 Falcon~\citep{simchi2022bypassing} 及其线性奖励版本~\citep[][Section 4]{xu2020upper},其核心在于选择一种称为 ``exploitative F-design'' 的动作分布,同时保证低 regret 与良好 coverage,从而在探索与开发之间进行权衡。我们引入一种新复杂度度量 Decision-Offline Estimation Coefficient (DOEC),并证明其在有界 Eluder 维度 per-context 及平滑 regret 设置下被上界。我们还建立了 DOEC 与 Decision Estimation Coefficient (DEC)~\citep{foster2021statistical} 之间的关系,首次将离线-与在线-oracle 高效的上下文型多臂赌博机算法设计原则建立联系。

关键词

引用

@article{arxiv.2602.09456,
  title  = {Taming the Monster Every Context: Complexity Measure and Unified Framework for Offline-Oracle Efficient Contextual Bandits},
  author = {Hao Qin and Chicheng Zhang},
  journal= {arXiv preprint arXiv:2602.09456},
  year   = {2026}
}

备注

40 pages (13 pages main body, 24 pages supplementary materials)