可扩展且可解释的上下文多臂赌博机:文献综述与零售优惠原型
机器学习
2025-05-23 v1
摘要
本文对上下文多臂赌博机(CMAB)方法进行了简洁综述,并提出了一种可扩展、可解释的优惠选择实验框架,以应对快速变化优惠的挑战。该方法在产品类别层面建模上下文,允许优惠跨越多个类别,并实现相似优惠之间的知识迁移,从而提升动态环境中的学习效率和泛化能力。该框架扩展了标准 CMAB 方法以支持多类别上下文,并通过高效的特征工程和模块化设计实现可扩展性。MPG(会员购买间隔)和 MF(矩阵分解)等高级特征捕捉了用户与优惠之间的细微交互,以 Python 实现便于实际部署。关键贡献在于大规模可解释性:逻辑回归模型产生透明的权重向量,可通过大语言模型(LLM)接口访问,用于实时跟踪和解释用户不断变化的偏好。这使得生成详细的会员画像和识别行为模式成为可能,支持个性化优惠优化并增强对自动化决策的信任。通过将我们的原型与广义线性模型和汤普森采样等成熟范式并置,我们展示了其在研究和实际 CMAB 应用中的价值。
引用
@article{arxiv.2505.16918,
title = {Scalable and Interpretable Contextual Bandits: A Literature Review and Retail Offer Prototype},
author = {Nikola Tankovic and Robert Sajina},
journal= {arXiv preprint arXiv:2505.16918},
year = {2025}
}