线性多臂老虎机中Nash福利的最优算法
机器学习
2026-02-02 v1
摘要
Nash后悔近期作为公平性感知的随机多臂老虎机性能指标而浮出水面,灵感来自Nash社会福利目标。尽管这一概念已被推广到线性老虎机问题,但现有结果在环境维数上存在次优,源于依赖受限浓度不等式的证明技术。本文通过引入新的分析工具,解决了这一开放问题,得到线性老虎机中阶最优的Nash后悔上界。除Nash后悔外,我们还着手研究-均值后悔(-means regret),这是一种统一框架,用于在公平性与效用目标之间插值,严格概括了Nash后悔。我们提出了一种通用的算法框架FairLinBandit,作为任何线性老虎机策略的元算法。我们使用两种老虎机算法:Phased Elimination和Upper Confidence Bound,对其进行实例化,证明它们在整个的范围内都能实现亚线性-均值后悔。对来自真实数据集的线性老虎机实例进行大量实验,表明我们的方法在持续优于现有最先进基准方面。
引用
@article{arxiv.2601.22969,
title = {Improved Algorithms for Nash Welfare in Linear Bandits},
author = {Dhruv Sarkar and Nishant Pandey and Sayak Ray Chowdhury},
journal= {arXiv preprint arXiv:2601.22969},
year = {2026}
}