BanditLP:面向个性化推荐的大规模随机优化
机器学习
2026-01-23 v1 人工智能
机器学习
摘要
我们提出了 BanditLP,这是一个可扩展的多利益相关者上下文 Bandit 框架,它将用于学习特定目标结果的神经 Thompson Sampling 与用于服务时受约束动作选择的大规模线性规划统一起来。该方法论是应用无关的,兼容任意神经架构,并且可部署于网络规模,其 LP 求解器能够处理数十亿个变量。在公共基准和合成数据上的实验显示,相对于强基线有一致的提升。我们将这种方法应用于 LinkedIn 的电子邮件营销系统,并展示了商业上的胜利,说明了集成探索和约束优化在生产中的价值。
引用
@article{arxiv.2601.15552,
title = {BanditLP: Large-Scale Stochastic Optimization for Personalized Recommendations},
author = {Phuc Nguyen and Benjamin Zelditch and Joyce Chen and Rohit Patra and Changshuai Wei},
journal= {arXiv preprint arXiv:2601.15552},
year = {2026}
}