中文

分布式深度森林及其在套现欺诈自动检测中的应用

机器学习 2020-03-17 v3 机器学习

摘要

互联网公司每天都面临着处理大规模机器学习应用的需求,能够以优异性能处理超大尺度任务的机器学习算法的分布式实现被广泛需要。深度森林是近期提出的一种深度学习框架,其以树集成作为基本构件,并在各类任务领域取得了极具竞争力的结果。然而,它尚未在极大规模任务上得到验证。在本工作中,我们基于参数服务器系统开发了深度森林的分布式版本。为满足真实世界任务的需求,对原始深度森林模型引入了多项改进,包括出于效率与效果考虑采用 MART(多重加性回归树)作为基学习器、用于处理普遍存在的类别不平衡数据的基于代价的方法、针对高维数据的基于 MART 的特征选择,以及用于自动确定级联层数的不同评估指标。我们在一个超大规模任务(即套现欺诈自动检测,训练样本超过 1 亿)上测试了深度森林模型。实验结果表明,从不同角度的评估指标来看,深度森林模型即便在极少参数调优的情况下也具备最佳性能。该模型每天可阻断大量资金的欺诈交易。即便与已部署的最佳模型相比,深度森林模型每天还能额外显著减少经济损失。

关键词

引用

@article{arxiv.1805.04234,
  title  = {Distributed Deep Forest and its Application to Automatic Detection of Cash-out Fraud},
  author = {Ya-Lin Zhang and Jun Zhou and Wenhao Zheng and Ji Feng and Longfei Li and Ziqi Liu and Ming Li and Zhiqiang Zhang and Chaochao Chen and Xiaolong Li and Zhi-Hua Zhou and YUAN and QI},
  journal= {arXiv preprint arXiv:1805.04234},
  year   = {2020}
}