中文

连续数据流中有限混合 logistic 回归模型的最大似然估计

机器学习 2018-03-01 v1 统计计算 机器学习

摘要

在营销中,我们经常面对对营销信息的连续响应流。此类流数据提供了关于信息有效性与细分人群的宝贵信息。然而,流数据难以用常规方法分析:其海量以及持续扩充的特性意味着分析它们需耗费大量时间。我们提出一种估计有限混合 logistic 回归模型的方法,可用于基于连续响应流对客户分群。该方法被我们命名为 oFMLR,可在数据流或极大型静态数据集中识别细分群体。与黑箱算法不同,oFMLR 提供的模型估计可直接解释。我们首先介绍 oFMLR,顺带阐释在线估计与 EM 算法等通用主题,使本文成为应对营销实践中大数据流之可行方法的高层次概览。接着,我们讨论模型收敛性、可识别性,以及与替代的贝叶斯方法的关系;我们也指出了由持续扩充数据集引发的更一般问题。最后,我们介绍了 oFMLR [R] 包,并通过数值模拟与分析一个大型客户点击流数据集对该方法进行评估。

关键词

引用

@article{arxiv.1802.10529,
  title  = {Maximum likelihood estimation of a finite mixture of logistic regression models in a continuous data stream},
  author = {Maurits Kaptein and Paul Ketelaar},
  journal= {arXiv preprint arXiv:1802.10529},
  year   = {2018}
}

备注

1 figure. Working paper including [R] package