中文

利用合成数据可证明地改善少样本模型的泛化能力

机器学习 2025-06-26 v2 计算机视觉与模式识别

摘要

由于标注训练样本的稀缺,少样本图像分类仍具挑战性。利用合成数据对其进行增强已成为缓解该问题的一种有效途径,但由于真实分布与合成分布之间存在固有差距,在合成样本上训练的模型往往面临性能下降。为解决这一局限性,我们构建了一个理论框架,用于量化此类分布差异对监督学习的影响,特别是在图像分类的背景下。更重要的是,我们的框架提供了生成优质合成样本以及训练具有高泛化能力预测器的实用方法。基于该框架,我们提出了一种基于理论的新颖算法,该算法集成了原型学习来优化数据划分与模型训练,有效弥合了真实少样本数据与合成数据之间的差距。大量实验结果表明,与现有最先进的方法相比,我们的方法展现出更优越的性能,在多个数据集上均优于它们。

关键词

引用

@article{arxiv.2505.24190,
  title  = {Provably Improving Generalization of Few-Shot Models with Synthetic Data},
  author = {Lan-Cuong Nguyen and Quan Nguyen-Tri and Bang Tran Khanh and Dung D. Le and Long Tran-Thanh and Khoat Than},
  journal= {arXiv preprint arXiv:2505.24190},
  year   = {2025}
}

备注

ICML 2025. Our code is released at https://github.com/Fsoft-AIC/ProtoAug