理解数据增强在不平衡数据上如何起作用
机器学习
2023-04-13 v1
摘要
数据增强构成了许多现代机器学习训练流程的基石;然而,其起作用的内在机制尚未被清晰理解。关于数据增强(DA)的研究多集中于改进现有技术、考察其在神经网络过拟合背景下的正则化效应,或探究其对特征的影响。在此,我们对 DA 在三种常用监督分类器(卷积神经网络、支持向量机和逻辑回归模型)上用于不平衡数据分类时的效应进行了整体考察。我们以三个图像和五个表格数据集上的测试支撑该考察。我们的研究表明,当应用于不平衡数据时,DA 会对模型权重、支持向量和特征选择产生实质性改变;即便其可能仅对平衡准确率或 F1 度量等全局指标产生相对温和的变化。我们假设 DA 通过促进数据中的方差来起作用,从而使机器学习模型能将数据的变化与标签关联起来。通过使模型为预测一个标签而必须识别的特征幅度范围多样化,DA 提升了模型在不平衡数据上学习时的泛化能力。
引用
@article{arxiv.2304.05895,
title = {Towards Understanding How Data Augmentation Works with Imbalanced Data},
author = {Damien A. Dablain and Nitesh V. Chawla},
journal= {arXiv preprint arXiv:2304.05895},
year = {2023}
}