小间隙下具有上下文信息的最佳臂辨识
机器学习
2023-01-05 v4 计量经济学
统计理论
统计方法学
机器学习
统计理论
摘要
我们研究具有固定预算和上下文(协变量)信息的最佳臂辨识(BAI)问题。在自适应实验的每一轮中,观测到上下文信息后,我们利用过去的观测和当前上下文选择处理臂。我们的目标是辨识最佳处理臂,即关于上下文分布边缘化后期望奖励最大的处理臂,并使误辨识概率最小。在本研究中,我们考虑一类非参数 bandit 模型,当间隙趋于零时收敛到位置偏移模型。首先,我们在小间隙机制下推导了某类策略和 bandit 模型(潜在结果的概率模型)的误辨识概率下界。小间隙机制是指最佳与次优处理臂之间期望奖励间隙趋于零的情形,这对应于辨识最佳处理臂的最坏情况之一。随后我们开发了“随机采样(RS)-增广逆概率加权(AIPW)策略”,该策略在小间隙机制下当预算趋于无穷时渐近最优,即该策略下的误辨识概率与下界匹配。RS-AIPW 策略由跟踪目标样本分配比的 RS 规则和采用 AIPW 估计量的推荐规则组成。
引用
@article{arxiv.2209.07330,
title = {Best Arm Identification with Contextual Information under a Small Gap},
author = {Masahiro Kato and Masaaki Imaizumi and Takuya Ishihara and Toru Kitagawa},
journal= {arXiv preprint arXiv:2209.07330},
year = {2023}
}
备注
For the sake of completeness, we show a part of the results of Kato et al. (arXiv:2201.04469). arXiv admin note: text overlap with arXiv:2201.04469