中文

用共轭贝叶斯模型编码类别变量用于WeWork线索评分引擎

机器学习 2019-05-01 v1 机器学习

摘要

各行业的应用数据科学家普遍面临将高基数类别特征编码为机器学习算法可处理输入的挑战性任务。本文描述了为WeWork线索评分引擎开发的贝叶斯编码技术,该引擎基于交互、 enrichment和地理空间数据输出人员参观我们办公空间的概率。我们提出了一种集成建模范式,减轻了对类别变量构建复杂预处理和编码方案的需求。特别地,领域特定的共轭贝叶斯模型被用作堆叠集成模型中特征的基学习器。对于类别特征矩阵的每一列,我们拟合问题特定的先验分布,例如二分类问题的Beta分布。为解析推导后验分布的矩,我们用给定类别特征每个唯一值对应目标变量的共轭似然更新先验。这种列与值的函数将类别特征矩阵编码,使集成模型中的最终学习器摄入低维数值输入。在精心整理和真实世界数据集上的实验结果表明,在多种问题原型上均具有令人印象深刻的准确率和计算效率。特别是,对于WeWork的线索评分引擎——其中某些类别特征多达300,000个水平——我们通过实施共轭贝叶斯模型编码将AUC从0.87提升至0.97。

关键词

引用

@article{arxiv.1904.13001,
  title  = {Encoding Categorical Variables with Conjugate Bayesian Models for WeWork Lead Scoring Engine},
  author = {Austin Slakey and Daniel Salas and Yoni Schamroth},
  journal= {arXiv preprint arXiv:1904.13001},
  year   = {2019}
}