中文

改变训练数据分布以降低简单性偏差可改善分布内泛化能力

机器学习 2026-03-03 v3 人工智能 计算机视觉与模式识别

摘要

我们能否通过修改训练数据分布,促使底层优化方法找到在分布内数据上具有优异泛化性能的解?在本工作中,我们首次通过比较梯度下降(GD)与锐度感知最小化(SAM)的归纳偏差来探讨这个问题。通过研究双层 CNN,我们严格证明了 SAM 能更均匀地学习不同特征,尤其是在早期训练阶段。也就是说,与 GD 相比,SAM 较不易受到简单性偏差的影响。我们还表明,包含早期学习到特征的样本可以基于模型输出与其余样本分离。基于这一观察,我们提出了一种方法: 在训练早期基于网络输出对样本进行聚类; 识别具有相似网络输出的样本簇; 仅对其余样本进行一次上采样以缓解简单性偏差。我们通过实验证明,USEFUL 在使用包括 (S)GD 和 SAM 在内的各种梯度方法进行训练时,能有效提升在原始数据分布上的泛化性能。值得注意的是,我们展示了我们的方法可以与 SAM 变体和现有的数据增强策略相结合,据我们所知,在 CIFAR10、STL10、CINIC10、Tiny-ImageNet 上训练 ResNet18,在 CIFAR100 上训练 ResNet34,以及在 CIFAR10 上训练 VGG19 和 DenseNet121,均实现了 SOTA 性能。我们的代码可在 https://github.com/BigML-CS-UCLA/TADA 获取。

关键词

引用

@article{arxiv.2404.17768,
  title  = {Changing the Training Data Distribution to Reduce Simplicity Bias Improves In-distribution Generalization},
  author = {Dang Nguyen and Paymon Haddad and Eric Gan and Baharan Mirzasoleiman},
  journal= {arXiv preprint arXiv:2404.17768},
  year   = {2026}
}

备注

43 pages, 15 figures, 9 tables, link: https://github.com/BigML-CS-UCLA/TADA