中文

基于自动化机器学习的数据增强:方法与经典数据增强方法的性能比较

机器学习 2025-03-07 v3 人工智能 计算机视觉与模式识别 神经与进化计算

摘要

数据增强可以说是常用于提高机器学习模型泛化性能的最重要的正则化技术。它主要涉及应用适当的数据变换操作来创建具有所需属性的新数据样本。尽管其有效,但该过程通常具有挑战性,因为需要耗时的手动试错程序来创建和测试不同的候选增强及其超参数。最先进的方法越来越依赖于自动化机器学习(AutoML)原则。本文对基于AutoML的数据增强技术进行了全面综述。我们讨论了使用AutoML实现数据增强的各种方法,包括数据操纵、数据集成和数据合成技术。本工作的重点是图像数据增强方法。尽管如此,我们也涵盖了其他数据模态,特别是在所讨论的特定数据增强技术更适合这些其他模态的情况下。例如,由于自动化数据集成方法更适合表格数据,我们在讨论数据集成方法时涵盖了表格数据。本工作还对完成图像数据增强过程的每个主要子任务(搜索空间设计、超参数优化和模型评估)的技术进行了广泛讨论。最后,我们对自动化数据增强技术和基于经典增强方法的最先进方法的性能进行了广泛的比较和分析。结果表明,用于数据增强的AutoML方法目前优于基于传统方法的最先进技术。

关键词

引用

@article{arxiv.2403.08352,
  title  = {Data augmentation with automated machine learning: approaches and performance comparison with classical data augmentation methods},
  author = {Alhassan Mumuni and Fuseini Mumuni},
  journal= {arXiv preprint arXiv:2403.08352},
  year   = {2025}
}