生成数据将在未来图像分类模型中放大跨代偏差吗?
计算机视觉与模式识别
2024-10-15 v1
摘要
随着对高质量训练数据的需求的增长,研究者越来越多地利用生成模型创建合成数据,以解决数据稀缺问题并实现持续的模型改进。然而,依赖自生成数据引入了一个关键问题:这是否会放大未来模型的偏差?虽然大多数研究聚焦于整体性能,但对模型偏差,特别是子群偏差的影响仍未得到充分探讨。本文研究了生成数据对图像分类任务的影响,特别关注偏差问题。我们开发了一个实用仿真环境,集成一个自消费循环,其中生成模型和分类模型被同步训练。在 Colorized MNIST、CIFAR-20/100 和 Hard ImageNet 数据集上进行了大量实验,以揭示跨代公平性指标的变化。此外,我们提供了一个解释在持续增强的数据集上训练模型的偏差动态的猜想。我们的发现为合成数据在现实应用中公平性的影响提供了贡献。
引用
@article{arxiv.2410.10160,
title = {Will the Inclusion of Generated Data Amplify Bias Across Generations in Future Image Classification Models?},
author = {Zeliang Zhang and Xin Liang and Mingqian Feng and Susan Liang and Chenliang Xu},
journal= {arXiv preprint arXiv:2410.10160},
year = {2024}
}
备注
15 pages, 7 figures