中文

自适应采样的收益与代价

统计方法学 2026-04-28 v1 计量经济学

摘要

多臂老虎机被广泛应用于临床试验、推荐系统和在线平台中的序贯实验。尽管遗憾最小化与从自适应收集的数据中进行有效推断均已被广泛研究,但一个基本问题仍然存在:自适应何时相对于均匀设计能改善估计精度,以及应如何平衡推断与在线实验代价?我们首先研究均方误差(MSE)目标下的臂级均值估计。我们刻画了自适应 Neyman 分配(根据臂方差分配样本)何时能比均匀采样带来严格的 MSE 改善。当各臂间存在方差异质性时,这些改善在适中的样本量下即可出现,这表明自适应不仅渐近意义上更利于推断,在许多实际的有限样本场景中亦然。随后,我们研究了一个联合推断-遗憾目标,该目标考虑了实验期间将个体分配至劣臂的代价。我们提出了静态分配速率策略(SARP)和 Neyman 自适应速率策略(NARP),它们通过根据实例的局部结构调整探索程度,在面向推断和面向遗憾的策略之间进行插值。我们证明,随着采样预算的增长,SARP 和 NARP 以最优速率收敛于完全信息基准。我们提出的策略在实际中具有吸引力,因为它能在任意标准遗憾最小化算法与面向推断的自适应策略之间进行线性插值。然而我们证明,它仍然享有基于预言机的渐近最优速率。仿真实验通过在一系列实例中展示相较于均匀分配的精度提升且控制性能损失,验证了理论分析。

关键词

引用

@article{arxiv.2604.24652,
  title  = {Benefits and Costs of Adaptive Sampling},
  author = {Yu-Shiou Willy Lin and Dae Woong Ham and Iavor Bojinov},
  journal= {arXiv preprint arXiv:2604.24652},
  year   = {2026}
}

备注

41 pages, 3 figures