中文

面向大规模在线实验中流失购买者的基于聚类的填补方法

机器学习 2023-04-10 v3 信息检索

摘要

在在线实验中,恰当的指标(如购买)为支持假设并改进决策过程提供了有力证据。然而,在线实验中指标不完整的现象频繁发生,使得可用数据远少于计划的在线实验(如 A/B 测试)。本文引入流失购买者概念,并将具有不完整指标值的用户分为两类:访客与流失购买者。针对不完整指标的分析,我们提出一种基于聚类的 kk 近邻填补方法。所提填补方法同时考虑实验特定特征与用户沿购物路径的活动,从而对不同用户给出不同填补值。为便于对在线实验中大规模数据集的高效填补,该方法结合分层与聚类。在仿真研究及 eBay 真实在线实验中,将所提方法性能与若干常规方法进行比较。

关键词

引用

@article{arxiv.2209.06125,
  title  = {Clustering-based Imputation for Dropout Buyers in Large-scale Online Experimentation},
  author = {Sumin Shen and Huiying Mao and Zezhong Zhang and Zili Chen and Keyu Nie and Xinwei Deng},
  journal= {arXiv preprint arXiv:2209.06125},
  year   = {2023}
}