中文

具有多用户延迟反馈的对抗式老虎机:理论与应用

机器学习 2024-02-13 v2

摘要

多臂老虎机(MAB)模型因其在资源分配、在线广告和动态定价等各种现实场景中的适用性和有效性而吸引了大量研究关注。作为一个重要分支,具有延迟反馈的对抗式MAB问题近来已被许多研究者提出并研究,其中概念上的对手策略性地选择与每个臂相关的奖励分布以挑战学习算法,且智能体在执行动作与接收到相应奖励反馈之间存在延迟。然而,现有模型将反馈限制为仅由单一用户生成,这使得模型不适用于普遍存在的多用户场景(例如面向一组用户的广告推荐)。在本文中,我们考虑延迟反馈结果来自多个用户且对其内部分布无限制。相反,反馈延迟是任意的且玩家事先未知。此外,对于一轮中的不同用户,反馈延迟不假设存在潜在相关性。因此,我们形式化了一个具有多用户延迟反馈的对抗式MAB问题,并设计了一种改进的EXP3算法MUD-EXP3,该算法通过考虑来自不同用户的已接收反馈的重要性加权估计在每轮做出决策。在已知终止轮次索引TT、用户数MM、臂数NN以及延迟上界dmaxd_{max}的前提下,我们证明了O(TM2lnN(Ne+4dmax))\mathcal{O}(\sqrt{TM^2\ln{N}(N\mathrm{e}+4d_{max})})的遗憾界。此外,对于更常见的TT未知情形,提出了一种自适应算法AMUD-EXP3,其相对于TT具有亚线性遗憾。最后,进行了大量实验以表明我们算法的正确性与有效性。

关键词

引用

@article{arxiv.2310.11188,
  title  = {Adversarial Bandits with Multi-User Delayed Feedback: Theory and Application},
  author = {Yandi Li and Jianxiong Guo and Yupeng Li and Tian Wang and Weijia Jia},
  journal= {arXiv preprint arXiv:2310.11188},
  year   = {2024}
}

备注

This is an extended version of "A Modified EXP3 in Adversarial Bandits with Multi-User Delayed Feedback" published in COCOON 2023