中文

基于混合反馈的广义线性 bandit 中的最佳臂识别

人工智能 2026-05-08 v1

摘要

我们研究了在混合反馈模型下的广义线性 bandit 中的固定置信度最佳臂识别问题。在每一轮中,学习者可以查询(i)来自单个臂的绝对奖励反馈,或(ii)来自臂对的相对(对决)反馈,这两种反馈均受制于广义线性模型。我们引入了一个基于似然比的置信序列方法,统一了异构的广义线性观测,并在自圆锥性假设下推导出显式的椭球置信集合。基于该置信集合,我们提出了一种混合 Track-and-Stop 算法,通过在臂和配对的联合动作空间上跟踪 minimax 最优设计来自适应分配查询。我们证明了该算法的 δ\delta 正确性,并给出了停止时间的高概率上界。我们进一步扩展了框架,以成本感知的设置进行了考虑,既考虑了不同反馈模式的异构获取成本,也考虑了实际应用中的经济约束。实验结果表明,所提出的算法在基线方法之上显著提高了样本效率。

关键词

引用

@article{arxiv.2605.05745,
  title  = {Best Arm Identification in Generalized Linear Bandits via Hybrid Feedback},
  author = {Qirun Zeng and Xuchuang Wang and Jiayi Shen and Xutong Liu and Fang Kong and Jinhang Zuo},
  journal= {arXiv preprint arXiv:2605.05745},
  year   = {2026}
}