面向线性 Bandit 且具有非平稳鲁棒性的 A/B 测试与最优臂辨识
机器学习
2024-02-16 v2 机器学习
摘要
我们研究潜在非平稳环境下线性 bandit 的固定预算最优臂辨识 (BAI) 问题。给定有限臂集 、固定预算 以及不可预测的参数序列 ,算法将以尽可能高的概率正确辨识最优臂 。先前工作已解决平稳设定(即对所有 有 )并证明错误概率以 下降,其中 为依赖问题的常数。但在许多激励本工作的现实世界 多变量测试场景中,环境是非平稳的,期望平稳设定的算法很容易失败。对于鲁棒辨识,众所周知若每时刻从 上的 G-最优设计随机非自适应地选择臂,则错误概率以 下降,其中 。由于存在 的环境,我们受此驱动提出一种新颖算法 -,旨在兼得两者优势:对非平稳性的鲁棒性以及在良性设定下的快速辨识速率。我们刻画了 - 的错误概率,并通过实证表明该算法确实从不差于 G-最优设计,且在平稳设定下优于最优算法。
引用
@article{arxiv.2307.15154,
title = {A/B Testing and Best-arm Identification for Linear Bandits with Robustness to Non-stationarity},
author = {Zhihan Xiong and Romain Camilleri and Maryam Fazel and Lalit Jain and Kevin Jamieson},
journal= {arXiv preprint arXiv:2307.15154},
year = {2024}
}
备注
25 pages, 6 figures