中文

在真实信用卡欺诈检测数据库上评估类别编码方法

机器学习 2021-12-23 v1

摘要

在监督学习场景下正确处理类别数据仍是一个主要问题。此外,尽管某些机器学习方法内建了处理类别特征的机制,但尚不清楚它们是否带来改进,以及它们与常用类别编码方法相比表现如何。本文描述了几种基于目标统计与证据权重的知名类别编码方法。我们将其应用于一个大规模真实信用卡欺诈检测数据库。随后,我们使用最先进的梯度提升方法训练编码后的数据库并评估其性能。我们表明,相对于不进行编码,类别编码方法通常带来显著改进。本工作的贡献有两点:(1) 我们在大规模数据库上比较了许多最先进的“轻量”类别编码方法;(2) 我们使用了一个真实的信用卡欺诈检测数据库。

关键词

引用

@article{arxiv.2112.12024,
  title  = {Evaluating categorical encoding methods on a real credit card fraud detection database},
  author = {François de la Bourdonnaye and Fabrice Daniel},
  journal= {arXiv preprint arXiv:2112.12024},
  year   = {2021}
}