中文

基于实例依赖保证的带成本补贴的两两消除

机器学习 2025-12-22 v3

摘要

多臂老虎机(MAB)常用于序列在线决策,其中每种决策的奖励是未知的随机变量。然而,通常目标是最大化总奖励,而在实际中更重要的是在满足奖励约束的前提下最小化决策的总成本。例如,我们可能希望做出至少具有默认值参考决策所需奖励的决策,且成本尽可能低。这一问题最近在带成本补贴的多臂老虎机(MAB-CS)框架中被引入。MAB-CS 广泛适用于主要指标(成本)受次要指标(奖励)约束的领域,奖励为未知。我们在本文中解决了 MAB-CS 的各种变体,包括由已知参考臂的奖励或由补贴后最佳奖励所约束的奖励。我们引入了用于已知参考臂变体的两两消除(PE)算法,并将 PE 推广到针对补贴后最佳奖励变体的 PE-CS。我们对 PE 和 PE-CS 的实例依赖分析揭示了这两个算法在成本和质量忧伤方面都具有阶级对数上界,这使我们的政策成为首个具有此类保证的算法。此外,通过比较我们的上界和下界结果,我们确立了 PE 对所有已知参考臂问题实例都是阶最优的。最后,我们使用 MovieLens 25M 和 Goodreads 数据集对 PE 和 PE-CS 进行实验,揭示了 PE 的有效性以及 PE-CS 在性能和可靠性之间提供的优越平衡。

关键词

引用

@article{arxiv.2501.10290,
  title  = {Pairwise Elimination with Instance-Dependent Guarantees for Bandits with Cost Subsidy},
  author = {Ishank Juneja and Carlee Joe-Wong and Osman Yağan},
  journal= {arXiv preprint arXiv:2501.10290},
  year   = {2025}
}

备注

ICLR 2025 Conference Paper