中文

生成式数据增强何时会伤害:GAN 与扩散模型在 AI 分类系统偏差纠正基准实验

计算机视觉与模式识别 2026-03-18 v1 人工智能 机器学习

摘要

生成模型广泛用于补偿 AI 训练管道中的类别不平衡,但在低数据条件下其失效模式仍鲜为人知。本文报告了对三种数据增强策略进行的受控基准测试,针对细粒度动物分类任务:传统变换、FastGAN 和使用低秩适配 (LoRA) 微调的 Stable Diffusion 1.5。使用 Oxford-IIIT Pet 数据集,设定八个人工欠代表的犬种,我们发现 FastGAN 数据增强不仅在极小训练集规模时表现不佳,还会主动增加分类器偏差,在三个随机随机种子下均呈现统计显著的大效应(偏差增幅:+20.7%,Cohen's d = +5.03,p = 0.013)。该效应大小足够大,尽管随机种子数量有限,仍能对发现方向提供信心。基于 t 分布随机邻域嵌入 (t-SNE) 的特征嵌入分析揭示,FastGAN 生成的严重欠代表犬种图像形成紧密的孤立聚类,位于真实图像分布之外,符合模式坍塌的模式。采用低秩适配的 Stable Diffusion 生成效果最佳,实现最高的宏平均 F1 分数(0.9125 ± 0.0047),并相对于未增强基线实现了 13.1% 的偏差缩减。数据表明,在本实验设置下,GAN 数据增强在每类训练图像数量在 20~50 之间可能成为有害的,尽管需要在更多领域进行进一步研究才能更准确地确定该阈值。所有实验均在拥有 6~8 GB 内存的消费级 GPU 上完成,不需要云计算资源。

关键词

引用

@article{arxiv.2603.16134,
  title  = {When Generative Augmentation Hurts: A Benchmark Study of GAN and Diffusion Models for Bias Correction in AI Classification Systems},
  author = {Shesh Narayan Gupta and Nik Bear Brown},
  journal= {arXiv preprint arXiv:2603.16134},
  year   = {2026}
}