基于带延迟奖励观测数据的仿真进行销售渠道优化:以 LinkedIn 为例
机器学习
2022-09-19 v1
摘要
在随机实验所获得的数据上训练模型是做出良好决策的理想方式。然而,随机实验往往耗时、昂贵、有风险、不可行或不道德,使得决策者在训练模型时别无选择,只能依赖历史策略下收集的观测数据。这不仅引发了哪些决策策略在实践中表现最佳的问题,也引发了不同数据收集协议对基于这些数据训练的各种策略性能的影响,或策略性能相对于问题特征变化(如观察结果时动作或奖励特定延迟)的鲁棒性问题。我们旨在为 LinkedIn 的销售渠道分配优化问题回答此类问题,其中销售账户(线索)需分配至三个渠道之一,目标是在一段时间内最大化成功转化数。该问题的关键特征在于观察分配结果时存在随机延迟,其分布依赖于渠道与结果。我们构建了一个可处理上述问题特征的离散时间仿真,并用其评估:a) 历史基于规则的策略;b) 监督式机器学习策略(XGBoost);以及 c) 多臂老虎机(MAB)策略,在不同情景下涉及:i) 用于训练的数据收集(观测式 vs 随机式);ii) 线索转化情景;iii) 延迟分布。我们的仿真结果表明,LinUCB(一种简单的 MAB 策略)始终优于其他策略,相较基于规则的策略实现了 18–47% 的提升。
引用
@article{arxiv.2209.07749,
title = {Sales Channel Optimization via Simulations Based on Observational Data with Delayed Rewards: A Case Study at LinkedIn},
author = {Diana M. Negoescu and Pasha Khosravi and Shadow Zhao and Nanyu Chen and Parvez Ahammad and Humberto Gonzalez},
journal= {arXiv preprint arXiv:2209.07749},
year = {2022}
}
备注
Accepted at REVEAL'22 Workshop (16th ACM Conference on Recommender Systems - RecSys 2022)