数据增强对预测模型性能的影响评估
机器学习
2024-12-04 v1 计算机与社会
摘要
在监督机器学习 (SML) 研究中,大型训练数据集对于获得有效结果至关重要。然而,在学习分析 (LA) 中获取原始数据具有挑战性。数据增强可通过扩充和多样化数据来缓解这一问题,尽管在 LA 中仍鲜有探索。本文系统比较了数据增强技术及其对预测性能在典型 LA 任务:学术结果预测中的影响。对四个 SML 模型进行了增强,并成功复制了来自前一项 LAK 研究中基于 AUC 值的结果。在 21 种增强技术中,SMOTE-ENN 采样表现最佳,平均 AUC 提升 0.01,并将训练时间大约缩短一半。此外,我们比较了 21 项技术的 99 种组合,发现在对 SMOTE-ENN 添加噪声后 (+0.014),模型间的性能提升虽小,但具有统计显著性。值得注意的是,某些增强技术显著降低了预测性能或增加了与随机机会有关的性能波动。本文的贡献有两个方面:首要的是,我们的实证发现表明,抽样技术为 LA 应用的 SML 提供最可靠的性能提升,并且在具有复杂超参数设置的深度生成方法之外更具计算效率。其次,LA 社区可能从独立复制的最新研究中受益。
引用
@article{arxiv.2412.02108,
title = {Evaluating the Impact of Data Augmentation on Predictive Model Performance},
author = {Valdemar Švábenský and Conrad Borchers and Elizabeth B. Cloude and Atsushi Shimada},
journal= {arXiv preprint arXiv:2412.02108},
year = {2024}
}
备注
Published in LAK 2025 conference proceedings in the ACM Digital Library, see https://doi.org/10.1145/3706468.3706485