处理零膨胀数据:以双层机器学习方法达到 SOTA
机器学习
2023-10-13 v1
摘要
在许多情况下,机器学习模型必须学会在更广泛的数据范围内正确预测少数具有特定关注值的数据点,其中大量目标值为零。零膨胀数据可见于多种场景,如块状与间歇性需求、家电开关机的功耗、蒸馏过程中的杂质测量,乃至机场班车需求预测。零值的存在会影响模型学习并可能导致性能不佳。此外,零值还会扭曲用于计算模型预测质量的指标。本文展示了两个真实用例(家电分类与机场班车需求预测),其中在零膨胀数据背景下应用的分层模型取得了优异结果。特别地,对于家电分类,Precision、Recall、F1 与 AUC ROC 的加权平均值分别提升了 27%、34%、49% 与 27%。此外,据估计所提方法相比作为对比的 SOTA 方法能效高出四倍。在预测机场班车需求时,双层模型在所有情况下均表现最佳,且与其他模型的差异经证明具有统计显著性。
引用
@article{arxiv.2310.08088,
title = {Dealing with zero-inflated data: achieving SOTA with a two-fold machine learning approach},
author = {Jože M. Rožanec and Gašper Petelin and João Costa and Blaž Bertalanič and Gregor Cerar and Marko Guček and Gregor Papa and Dunja Mladenić},
journal= {arXiv preprint arXiv:2310.08088},
year = {2023}
}