正则化目标编码在高基数特征监督机器学习中优于传统方法
机器学习
2022-03-07 v2 机器学习
摘要
由于大多数机器学习(ML)算法是为数值输入设计的,高效编码分类变量是数据分析中的一个关键方面。一个常见问题是高基数特征,即具有大量水平的无序分类预测变量。我们研究了产生分类变量数值表示的技术,这些表示可用于后续的 ML 应用。我们关注这些技术对后续算法预测性能的影响,并尽可能推导关于何时使用哪种技术的最佳实践。我们进行了一项大规模基准实验,将不同编码策略与五种 ML 算法(lasso、随机森林、梯度提升、k近邻、支持向量机)在回归、二分类和多分类设置的数据集上进行比较。在我们的研究中,目标编码的正则化版本(即使用基于训练集中特征水平的目标预测作为新的数值特征)一致地提供了最佳结果。传统上广泛使用的编码,在创建二元指示变量(独热或哑变量编码)之前做出不合理假设以将水平映射为整数(例如整数编码)或减少水平数量(可能基于目标信息,例如叶编码),相比之下效果较差。
引用
@article{arxiv.2104.00629,
title = {Regularized target encoding outperforms traditional methods in supervised machine learning with high cardinality features},
author = {Florian Pargent and Florian Pfisterer and Janek Thomas and Bernd Bischl},
journal= {arXiv preprint arXiv:2104.00629},
year = {2022}
}
备注
Comput Stat (2022)