分位数编码器:处理回归问题中的高基数类别特征
机器学习
2021-07-06 v2
摘要
回归问题在机器学习文献中已被广泛研究,产生了大量回归模型和性能度量。然而,专门解决如何将类别特征纳入回归问题的方法很少。通常,类别特征编码器具有足够的通用性以覆盖分类和回归问题。这种缺乏针对性的情况导致回归模型表现不佳。在本文中,我们深入分析了如何利用分位数处理高基数类别特征。在考虑平均绝对误差(Mean Absolute Error)时,我们的方案优于现有编码器,包括传统的统计均值目标编码器,尤其在存在长尾或偏态分布的情况下。此外,为应对某些支持度较小的类别可能带来的过拟合,我们的编码器采用了加性平滑。最后,我们描述了如何通过创建一组具有不同分位数的特征来扩展编码值。这种扩展编码器提供了关于所讨论类别特征更具信息量的输出,进一步提升了回归模型的性能。
引用
@article{arxiv.2105.13783,
title = {Quantile Encoder: Tackling High Cardinality Categorical Features in Regression Problems},
author = {Carlos Mougan and David Masip and Jordi Nin and Oriol Pujol},
journal= {arXiv preprint arXiv:2105.13783},
year = {2021}
}
备注
Accepted at The 18th International Conference on Modeling Decisions for Artificial Intelligence (MDAI)