面向推荐系统的随机协变量激励探索:一种两阶段机制设计
信息检索
2026-05-26 v2 计算机科学与博弈论
机器学习
机器学习
摘要
推荐系统在互联网经济中发挥着关键作用,通过 connecting 用户与相关产品。然而,设计有效的推荐系统面临着关键挑战:在确保激励探索新产品的同时,如何权衡探索-开发之间的tradeoff,以迎合用户自身的偏好。在固定设计的线性多臂赌博机中,先前工作解决了贝叶斯激励相容性(BIC)问题(Sellke & Slivkins, 2023),而本文则针对在线抽样的随机用户协变量问题。不同于标准的黑盒化简方法(Mansour 等,2020),我们的方法利用线性奖励结构,实现亚线性 regret,同时满足激励约束。为此,我们提出了一种两阶段算法,将激励性探索与任何高效的离线学习算法相结合。在第一阶段,它在保持激励相容性的同时探索产品,以收集最优样本。第二阶段采用与任何高效学习方法集成的倒数比例间隙抽样策略(IPGS),以确保亚线性 regret。理论上,我们证明了算法 RCB 能够实现 的 regret,同时满足激励约束,并发现了激励预算与 regret 之间的tradeoff,这在实验中得到了验证。我们展示了 RCB 在个人化 warfarin 剂量调整的真实应用和仿真中的强劲激励收益、亚线性 regret 以及鲁棒性。
引用
@article{arxiv.2406.04374,
title = {Incentivized Exploration with Stochastic Covariates: A Two-Stage Mechanism Design for Recommender System},
author = {Yuantong Li and Guang Cheng and Xiaowu Dai},
journal= {arXiv preprint arXiv:2406.04374},
year = {2026}
}
备注
ICML 2026