中文

深度学习回归任务的数据增强技术

机器学习 2025-01-08 v1

摘要

深度学习 (DL) 模型在计算机视觉和自然语言处理等领域获得了显著应用,但在涉及表格数据的回归任务中仍未得到广泛应用。 In these cases, 传统机器学习 (ML) 模型往往优于 DL 模型。在本研究中,我们提出并评估了各种数据增强 (DA) 技术,以提高 DL 模型在表格数据回归任务中的性能。我们比较了神经网络通过不同 DA 策略获得的性能提升,这些策略范围从最简单的复制现有观察并添加噪声,到更复杂的保持数据中潜在统计关系的 DA 策略。我们的分析表明,先进的 DA 方法在多个数据集和回归任务上均显著提高了 DL 模型的性能,相较于无增强的基线模型平均提升超过 10%。这些 DA 策略的有效性通过 30 个独立数据集上的严格验证得出,其中包括多个迭代和使用三种自动深度学习 (AutoDL) 框架:AutoKeras、H2O 和 AutoGluon。本研究表明,通过利用先进的 DA 技术,DL 模型可以在回归任务中发挥其全部潜力,从而推动实际应用的更广泛采用和性能提升。

关键词

引用

@article{arxiv.2501.03654,
  title  = {Data Augmentation for Deep Learning Regression Tasks by Machine Learning Models},
  author = {Assaf Shmuel and Oren Glickman and Teddy Lazebnik},
  journal= {arXiv preprint arXiv:2501.03654},
  year   = {2025}
}