融合奖励与对抗反馈的随机多臂老虎机问题
机器学习
2025-04-23 v1 人工智能
摘要
本文研究了在随机多臂老虎机问题中融合绝对(奖励)和相对(对抗)反馈的方法,两类反馈在每个决策轮次中同时收集。我们推导了 regret 下界,表明高效算法可仅以较小两种反馈方式产生的 regret 为代价来完成每个臂的探索。我们提出了两种融合方法:(1)一种简单消除融合算法,利用两种反馈类型探索所有臂,并通过共享公共候选臂集合来统一收集的信息;(2)一种分解融合算法,选择更有效的反馈类型来探索相应的臂,并在每个轮次中随机分配一种反馈用于探索,另一种用于利用。消除融合因消除方法的内在次优性,在 regret 中产生臂数的次优乘子因子;相比之下,分解融合在常见假设下可将 regret 达到下界的常数因子。大量实验确认了我们算法和理论结果的有效性。
引用
@article{arxiv.2504.15812,
title = {Fusing Reward and Dueling Feedback in Stochastic Bandits},
author = {Xuchuang Wang and Qirun Zeng and Jinhang Zuo and Xutong Liu and Mohammad Hajiesmaili and John C. S. Lui and Adam Wierman},
journal= {arXiv preprint arXiv:2504.15812},
year = {2025}
}