线性_bandit 的纳什后悔保证
机器学习
2023-10-04 v1 计算机科学与博弈论
摘要
我们在随机线性 bandit 框架下获得了一种强化后悔概念的基本紧致上界。该强化概念——称为纳什后悔(Nash regret)——定义为(事先未知的)最优值与线性 bandit 算法所累积期望奖励的几何均值之差。由于几何均值对应于被广泛研究的纳什社会福利(NSW)函数,该表述量化了 bandit 算法跨轮次所产生集体福利的性能。已知 NSW 满足公平性公理,因此纳什后悔的上界提供了一种原则性的公平性保证。我们考虑 horizon 为 轮、臂集合为 、环境维度为 的随机线性 bandit 问题。此外,我们聚焦于每个臂关联的随机奖励为非负、-次泊松随机变量的设定。对此设定,我们开发的算法实现了 的纳什后悔。此外,针对臂集合 未必有限的线性 bandit 实例,我们获得了 的纳什后悔上界。由于有界随机变量是次泊松的,这些结果对有界正奖励亦成立。我们的线性 bandit 算法构建于逐次消除法之上,并包含新颖的技术洞见,如定制的集中界,以及结合 Kiefer-Wolfowitz 最优设计通过 John 椭球进行采样。
引用
@article{arxiv.2310.02023,
title = {Nash Regret Guarantees for Linear Bandits},
author = {Ayush Sawarni and Soumybrata Pal and Siddharth Barman},
journal= {arXiv preprint arXiv:2310.02023},
year = {2023}
}
备注
35 pages