中文

数据增强中的泛化差距:来自光照的见解

计算机视觉与模式识别 2024-08-22 v3

摘要

在计算机视觉领域,数据增强被广泛用于通过深度学习技术丰富训练数据集的特征复杂度。然而,关于模型的泛化能力,数据增强生成的人工特征与自然视觉特征之间的差异尚未被充分揭示。本研究引入了“视觉表示变量”的概念,将任务中可能的视觉变化定义为这些变量的联合分布。我们聚焦于视觉表示变量“光照”,通过模拟其分布退化,研究数据增强技术如何提升模型在分类任务上的性能。我们的目标是探究使用增强数据训练的模型与在真实光照条件下训练的模型在泛化能力上的差异。结果表明,在应用各种数据增强方法后,模型性能显著提升。然而,在使用多种数据增强方法后,仍然存在明显的泛化差距,这强调了训练集中特征多样性对于提升模型泛化能力的关键作用。

关键词

引用

@article{arxiv.2404.07514,
  title  = {Generalization Gap in Data Augmentation: Insights from Illumination},
  author = {Jianqiang Xiao and Weiwen Guo and Junfeng Liu and Mengze Li},
  journal= {arXiv preprint arXiv:2404.07514},
  year   = {2024}
}

备注

Accepted in ICPR 2024