中文

分类变量编码器在分类与回归任务中性能的比较研究

机器学习 2024-01-19 v1

摘要

分类变量经常出现在分类和回归任务的数据集中,需要在训练前编码为数值。由于许多编码器已被开发出来且可能显著影响性能,为任务选择合适的编码器成为一个耗时但重要的实际问题。本研究将机器学习模型大致分为三类:1) ATI模型,对输入隐式执行仿射变换,例如多层感知机神经网络;2) 基于决策树的树模型,例如随机森林;3) 其余模型,例如kNN。理论上,我们证明独热编码器是ATI模型的最佳选择,因为它可以通过从数据中学习合适的权重来模仿任何其他编码器。我们还解释了为什么目标编码器及其变体是树模型最合适的编码器。本研究进行了全面的计算实验,在28个数据集上评估了14种编码器(包括独热编码器和目标编码器)以及8种常见机器学习模型。计算结果与我们的理论分析一致。本研究的发现为数据科学家在欺诈检测、疾病诊断等领域如何选择合适的编码器提供了启示。

关键词

引用

@article{arxiv.2401.09682,
  title  = {Comparative Study on the Performance of Categorical Variable Encoders in Classification and Regression Tasks},
  author = {Wenbin Zhu and Runwen Qiu and Ying Fu},
  journal= {arXiv preprint arXiv:2401.09682},
  year   = {2024}
}