中文

受限供给下的离策略学习

机器学习 2026-05-19 v4

摘要

我们研究了情境bandits中的离策略学习(OPL),该方法在推荐系统和在线广告等众多实际应用中发挥关键作用。典型的情境bandits中的OPL假设是无限制的环境,使得策略可以无限选择相同的物品。然而,在许多实际应用中,包括优惠券分配和电子商务,受限供给通过分布式优惠券的预算限制或产品库存限制对物品施加约束。在这些设置下,针对当前用户选择期望奖励最高的物品的贪婪策略可能导致该物品提前耗尽,使其无法为可能产生更高期望奖励的未来用户提供。结果是,针对无限制设置下最优的OPL方法在受限供给设置下可能变得次优。为此,我们提供了理论分析表明,常规的贪婪OPL方法可能无法最大化策略性能,并演示在受限供给设置下必须存在性能更佳的策略。基于这一洞察,我们引入了一种新方法,称为受限供给的离策略学习(OPLS)。OPLS不仅选择期望奖励最高的物品,而是聚焦于相对于其他用户而言具有更高期望奖励的物品,从而更有效地分配受限供给的物品。我们的实证结果表明,在受限供给的情境bandits问题中,OPLS超越了现有的OPL方法。

关键词

引用

@article{arxiv.2603.18702,
  title  = {Off-Policy Learning with Limited Supply},
  author = {Koichi Tanaka and Ren Kishimoto and Bushun Kawagishi and Yusuke Narita and Yasuo Yamamoto and Nobuyuki Shimizu and Yuta Saito},
  journal= {arXiv preprint arXiv:2603.18702},
  year   = {2026}
}

备注

Published as a conference paper at WWW 2026