中文

混合奖励下的线性情境多臂老板问题:重新审视

机器学习 2024-09-05 v2 人工智能

摘要

我们研究了混合奖励设置下的线性情境多臂老板问题。在此设置下,每个臂的奖励模型包含针对该臂的特定参数以及所有臂奖励模型共享的参数。我们可以将该设置简化为两个密切相关的设置:(a)共享-无臂特定参数,和(b) disjoint-仅有臂特定参数,从而可以应用两种流行的领先算法-LinUCB和DisLinUCB。当臂特征是随机的且满足流行的多样性条件时,我们为两种算法提供新的 regret 分析,显著改进了这些算法已知的 regret 保证。我们的新分析关键利用了混合奖励结构和多样性条件。此外,我们引入了新算法HyLinUCB,该算法关键修改LinUCB(使用新的探索系数)以考虑稀疏性。在相同的多样性假设下,我们证明HyLinUCB也仅产生O(T\sqrt{T}) regret。我们在合成数据和真实世界数据集上进行大量实验,展示了HyLinUCB在实施方面的强大经验性能。对于臂特定参数远大于共享参数的数量,观察到DisLinUCB获得最低 regret。在这种情况下,HyLinUCB的 regret是第二好且与DisLinUCB极具竞争力。在所有其他情况下,包括我们的数据集,HyLinUCB的 regret显著低于LinUCB、DisLinUCB和其他SOTA基线。我们还经验观察到HyLinUCB的 regret随臂数的增长速度远低于基线方法,这使其即使适用于非常大的动作空间也能做到。

关键词

引用

@article{arxiv.2406.10131,
  title  = {Linear Contextual Bandits with Hybrid Payoff: Revisited},
  author = {Nirjhar Das and Gaurav Sinha},
  journal= {arXiv preprint arXiv:2406.10131},
  year   = {2024}
}

备注

Accepted at ECML PKDD 2024 as a Research Track Paper