批量非参数性情境多臂老虎机适应性壁垒:未知间隙参数的 regret 比率尖锐特征
统计理论
2025-11-12 v2 机器学习
机器学习
统计理论
摘要
我们研究了在间隙参数未知的情况下,对批量非参数性情境多臂老虎机问题进行建模。为捕捉这种无知带来的统计成本,我们引入了 regret 膨胀准则,即适应性算法 regret 与知道间隙参数的 oracle 的 regret 之比。我们表明,最优 regret 膨胀随时间 horizon T 的多项式增长,增长指数由一个依赖于维数、光滑性和批量数 M 的凸优化问题的值决定。此外,该优化问题的最小化者直接决定了批量分配和探索策略的速率最优算法。基于此原则,我们开发了 RoBIN(RObust batched algorithm with adaptive BINning),实现了最优 regret 膨胀(仅在对数因子误差内)。这些结果揭示了一种新的适应性壁垒:在批量情境下,针对未知间隙参数的适应性必然导致多项式惩罚,由一个变分问题尖锐刻画。值得注意的是,一旦批量数超过对数对数 T 的数量级,就可以恢复 oracle 的 regret 率(仅在对数因子误差内)。
引用
@article{arxiv.2511.03708,
title = {The Adaptivity Barrier in Batched Nonparametric Bandits: Sharp Characterization of the Price of Unknown Margin},
author = {Rong Jiang and Cong Ma},
journal= {arXiv preprint arXiv:2511.03708},
year = {2025}
}