中文

分类数据编码:还有比独热编码更‘热’的方法吗?

机器学习 2023-12-29 v1

摘要

约 40% 的现实世界问题中存在分类特征,凸显了编码作为预处理组件的关键作用。一些最近的研究报告了各种基于目标的编码器优于经典的与目标无关的方法。然而,这些主张缺乏任何统计分析的支持,且仅基于单个数据集或非常小且异质的数据集样本。本研究在来自 OpenML 存储库的穷尽分类问题样本中探讨了编码效应。我们将线性混合效应模型拟合到实验数据中,将任务 ID 视为随机效应,将编码方案和分类特征的各种特征视为固定效应。我们发现,在多类任务中,独热编码和 Helmert 对比编码优于基于目标的编码器。在二分类任务中,不同编码方案之间没有显著差异;然而,独热编码对结果表现出边际正向效应。重要的是,我们发现编码方案与分类特征的特征之间没有显著的交互作用。这表明我们的研究结果可推广到跨领域的各种问题。

关键词

引用

@article{arxiv.2312.16930,
  title  = {Encoding categorical data: Is there yet anything 'hotter' than one-hot encoding?},
  author = {Ekaterina Poslavskaya and Alexey Korolev},
  journal= {arXiv preprint arXiv:2312.16930},
  year   = {2023}
}