中文

比例响应:面向简单与累积后悔最小化的上下文赌博机

机器学习 2023-11-06 v3 机器学习

摘要

在诸多应用中,例如医疗健康与电子商务,上下文赌博机(contextual bandit)的目标可能是在实验结束时学习到最优处理分配策略。亦即,最小化简单后悔(simple regret)。然而,这一目标仍研究不足。我们针对随机上下文赌博机设定提出了一类新的计算高效赌博机算法,其中调谐参数决定了在累积后悔最小化(我们在此建立了近最优的极小极大保证)与简单后悔最小化(我们在此建立了最先进的保证)之间的权重分配。我们的算法适用于任意函数类,对模型误设具有鲁棒性,并可用于连续臂设定。这种灵活性源于构建并依赖于“保形臂集”(conformal arm sets, CASs)。CASs 为每个上下文提供一组臂,以跨上下文分布的一定概率涵盖该上下文特定的最优臂。我们在简单与累积后悔保证上的正面结果,与一个负面结果形成对比:该负面结果表明,任何算法都无法在取得依赖于实例的简单后悔保证的同时,取得极小极大最优的累积后悔保证。

关键词

引用

@article{arxiv.2307.02108,
  title  = {Proportional Response: Contextual Bandits for Simple and Cumulative Regret Minimization},
  author = {Sanath Kumar Krishnamurthy and Ruohan Zhan and Susan Athey and Emma Brunskill},
  journal= {arXiv preprint arXiv:2307.02108},
  year   = {2023}
}