中文

通过稳定性避免适应性推断成本:线性情境多臂老虎机的推断

机器学习 2026-01-09 v2 信息论 机器学习 math.IT 统计理论 统计理论

摘要

情境多臂老虎机中的统计推断面临适应性、非独立同分布数据带来的挑战。越来越多的研究表明,在适应性抽样下,经典最小二乘推断会失败,而对于线性函数的有效置信区间通常需要扩大dlogT\sqrt{d \log T}的量级。这一现象——常称为适应性价格——反映了在一般情境下进行可靠推断的内在困难。克服这一限制的关键结构条件是Lai和Wei的稳定性条件,该条件要求经验特征协方差收敛于确定性极限。在稳定性成立时,普通最小二乘估计量满足中心极限定理,经典Wald型置信区间在适应性情形下保持渐近有效,无需付出dlogT\sqrt{d \log T}的适应性价格。在本文中,我们提出并分析了一种用于线性情境多臂老虎机的正则化EXP4算法。我们的第一项主要结果表明,该程序满足Lai-Wei稳定性条件,因此可为线性函数提供有效的Wald型置信区间。我们另外提供了相关中心极限定理中估计量收敛的定量收敛速率。我们的第二项结果表明,同一算法实现的失效保证在对数因子上达到了最小混淆度最优,表明稳定性与统计效率可以在单一情境多臂老虎机方法中共存。作为本理论的应用,我们展示如何利用它在适应性收集的数据下构建条件平均处理效应( CATE)的置信区间。最后,我们通过仿真说明所得估计量的经验正态性以及相应置信区间的尖锐性。

关键词

引用

@article{arxiv.2512.20368,
  title  = {Avoiding the Price of Adaptivity: Inference in Linear Contextual Bandits via Stability},
  author = {Samya Praharaj and Koulik Khamaru},
  journal= {arXiv preprint arXiv:2512.20368},
  year   = {2026}
}

备注

Revised version containing additional quantitative rate of convergence for the CLT