DISCO:用于个性化折扣分配的端到端Bandit框架
机器学习
2024-06-14 v3 人工智能
摘要
个性化折扣码为电子商务中的客户关系管理和运营支出管理提供了强大机制。鉴于问题的部分信息性质以及适应不断变化的商业环境的需求,Bandit算法非常适合这一产品领域。在此,我们介绍DISCO,一个用于ASOS个性化折扣码分配的端到端上下文Bandit框架。DISCO通过将传统的汤普森采样算法与整数规划相结合,从而实现对运营成本的控制。由于Bandit学习在高维动作空间中通常效果较差,我们专注于构建低维的动作和上下文表示,同时仍能保持良好的准确性。此外,我们试图构建一个保留价格与销售之间关系的模型,即客户因价格降低而增加购买(“负价格弹性”)。这些目标通过使用径向基函数表示连续(即无限臂)动作空间,并结合从神经网络提取的上下文嵌入来实现。这些特征表示被用于汤普森采样框架中以促进探索,并进一步与整数规划集成,以在ASOS的客户群中分配折扣码。这些建模决策产生了一个奖励模型,该模型(a)能够跨相似动作进行联合学习,(b)高度准确,包括外推情况,以及(c)保留了预期的负价格弹性。通过离线分析,我们表明DISCO能够有效地进行探索,并在全局约束下随时间推移提升其性能。最后,我们对DISCO进行了严格的在线A/B测试,发现与旧系统相比,它在平均购物篮价值上实现了超过1%的显著提升。
引用
@article{arxiv.2406.06433,
title = {DISCO: An End-to-End Bandit Framework for Personalised Discount Allocation},
author = {Jason Shuo Zhang and Benjamin Howson and Panayiota Savva and Eleanor Loh},
journal= {arXiv preprint arXiv:2406.06433},
year = {2024}
}
备注
Accepted at ECML/PKDD 2024