中文

基于梯度引导的样本感知影响估计的即时数据增强

机器学习 2025-10-02 v1 计算机视觉与模式识别

摘要

数据增强广泛用于提高深度神经网络的泛化能力。大多数现有方法应用固定或随机变换。然而,我们发现样本难度随模型泛化能力的提升而演变。因此,在不考虑此类动态情况下应用均匀或随机增强,可能导致增强数据与模型演进训练需求之间的错配,最终降低训练效果。为此,我们引入SADA(Sample-Aware Dynamic Augmentation),通过对每个样本演进中其对模型优化影响的估计,在训练过程中动态调整增强强度。具体而言,我们通过将其梯度投影到累积的模型更新方向上并计算局部训练窗口内的时变方差来估计每个样本的影响。方差较小的样本(表明其影响稳定一致)将获得更强的增强以强调多样性,而不稳定的样本则采用温和的变换以保持语义忠实性并稳定学习。该方法轻量级,不需要辅助模型或策略调参,可作为可插即式模块无缝集成到现有训练管道中。多项基准数据集和模型架构实验表明,SADA在各项指标上均实现提升,包括在细粒度任务上提升7.3%,在长尾数据集上提升4.3%,凸显了该方法的有效性和实用性。

关键词

引用

@article{arxiv.2510.00434,
  title  = {On-the-Fly Data Augmentation via Gradient-Guided and Sample-Aware Influence Estimation},
  author = {Suorong Yang and Jie Zong and Lihang Wang and Ziheng Qin and Hai Gan and Pengfei Zhou and Kai Wang and Yang You and Furao Shen},
  journal= {arXiv preprint arXiv:2510.00434},
  year   = {2025}
}