中文

面向线性 Bandit 且具有非平稳鲁棒性的 A/B 测试与最优臂辨识

机器学习 2024-02-16 v2 机器学习

摘要

我们研究潜在非平稳环境下线性 bandit 的固定预算最优臂辨识 (BAI) 问题。给定有限臂集 XRd\mathcal{X}\subset\mathbb{R}^d、固定预算 TT 以及不可预测的参数序列 {θt}t=1T\left\lbrace\theta_t\right\rbrace_{t=1}^{T},算法将以尽可能高的概率正确辨识最优臂 x:=argmaxxXxt=1Tθtx^* := \arg\max_{x\in\mathcal{X}}x^\top\sum_{t=1}^{T}\theta_t。先前工作已解决平稳设定(即对所有 ttθt=θ1\theta_t = \theta_1)并证明错误概率以 exp(T/ρ)\exp(-T /\rho^*) 下降,其中 ρ\rho^* 为依赖问题的常数。但在许多激励本工作的现实世界 A/B/nA/B/n 多变量测试场景中,环境是非平稳的,期望平稳设定的算法很容易失败。对于鲁棒辨识,众所周知若每时刻从 X\mathcal{X} 上的 G-最优设计随机非自适应地选择臂,则错误概率以 exp(TΔ(1)2/d)\exp(-T\Delta^2_{(1)}/d) 下降,其中 Δ(1)=minxx(xx)1Tt=1Tθt\Delta_{(1)} = \min_{x \neq x^*} (x^* - x)^\top \frac{1}{T}\sum_{t=1}^T \theta_t。由于存在 Δ(1)2/d1/ρ\Delta_{(1)}^2/ d \ll 1/ \rho^* 的环境,我们受此驱动提出一种新颖算法 P1\mathsf{P1}-RAGE\mathsf{RAGE},旨在兼得两者优势:对非平稳性的鲁棒性以及在良性设定下的快速辨识速率。我们刻画了 P1\mathsf{P1}-RAGE\mathsf{RAGE} 的错误概率,并通过实证表明该算法确实从不差于 G-最优设计,且在平稳设定下优于最优算法。

关键词

引用

@article{arxiv.2307.15154,
  title  = {A/B Testing and Best-arm Identification for Linear Bandits with Robustness to Non-stationarity},
  author = {Zhihan Xiong and Romain Camilleri and Maryam Fazel and Lalit Jain and Kevin Jamieson},
  journal= {arXiv preprint arXiv:2307.15154},
  year   = {2024}
}

备注

25 pages, 6 figures