中文

数据增强最后一层重新训练方法的理论保证

机器学习 2024-05-10 v1 计算机视觉与模式识别 信息论 math.IT 机器学习

摘要

确保对训练数据中众多不同子族群的预测公平性对于大型模型来说往往代价高昂。最近,结合数据增强方法(如加权、下采样和混合增强)的简单线性最后一层重新训练策略,已被证明在最差族群准确率上实现了最佳性能——该指标衡量最少见子族群的准确率。对于线性最后一层重新训练及上述数据增强方法,我们在假设每个子族群的潜在表示(即最后一层的输入)分布为高斯分布时,给出最优的最差族群准确率。我们在合成数据和大型公开数据集上对结果进行评估和验证。

关键词

引用

@article{arxiv.2405.05934,
  title  = {Theoretical Guarantees of Data Augmented Last Layer Retraining Methods},
  author = {Monica Welfert and Nathan Stromberg and Lalitha Sankar},
  journal= {arXiv preprint arXiv:2405.05934},
  year   = {2024}
}

备注

Extended version of a paper accepted to ISIT 2024. arXiv admin note: text overlap with arXiv:2402.11039