面向冷启动探索的动态先验思林采样
机器学习
2026-02-03 v1
摘要
冷启动探索是大规模推荐系统中的核心挑战:新项或数据稀疏项必须获得流量以估计其价值,但过度探索会损害用户并浪费展示。实际中,常使用均匀 Beta(1,1) 先验初始化思林采样,隐含地假设未见项的成功率为 50%。当真实基准率远低于此时,这种乐观先验会系统性地为弱项分配过多资源。 batched policy 更新和管道延迟放大了这一影响:在数小时内,新推出的项可能保持“无数据”状态,先验在反馈被纳入前主导资源分配。我们提出动态先验思林采样,一种直接控制新臂击败当前冠军者的概率的先验设计。我们的关键贡献是闭式二次解,用于先验均值,确保在引入时 P(X_j > Y_k) = epsilon,从而使探索强度可预测可调,同时保留思林的贝叶斯更新。在蒙特卡洛验证、离线 batched 模拟以及面向数百万用户的缩略图个性化系统的大规模在线实验中,动态先验实现了精确的探索控制和更高的效率,优于均匀先验基线。
引用
@article{arxiv.2602.00943,
title = {Dynamic Prior Thompson Sampling for Cold-Start Exploration in Recommender Systems},
author = {Zhenyu Zhao and David Zhang and Ellie Zhao and Ehsan Saberian},
journal= {arXiv preprint arXiv:2602.00943},
year = {2026}
}