弥合差距:通过后处理技术增强合成数据的效用
计算机视觉与模式识别
2023-06-07 v2 人工智能
机器学习
摘要
获取并标注合适的数据集来训练深度学习模型是一项挑战。这通常会导致繁琐且耗时的工作,从而阻碍研究进展。然而,生成模型已成为生成合成数据集以替代或增强真实数据的一种有前景的解决方案。尽管如此,合成数据的有效性因其无法完全捕捉真实数据的复杂性和多样性而受到限制。为了解决这个问题,我们探索使用生成对抗网络生成合成数据集来训练分类器,随后在真实图像上对这些分类器进行评估。为了提高合成数据集的质量和多样性,我们提出了三种新颖的后处理技术:动态样本过滤、动态数据集回收和扩展技巧。此外,我们引入了一个名为Gap Filler (GaFi)的流水线,它以最优且协调的方式应用这些技术,以最大化在真实数据上的分类准确率。我们的实验表明,GaFi在Fashion-MNIST、CIFAR-10和CIFAR-100数据集上分别将真实准确率分数的差距有效缩小至2.03%、1.78%和3.99%的误差。这些结果代表了分类准确率分数的最新技术水平,并突显了后处理技术在提高合成数据集质量方面的有效性。
引用
@article{arxiv.2305.10118,
title = {Bridging the Gap: Enhancing the Utility of Synthetic Data via Post-Processing Techniques},
author = {Andrea Lampis and Eugenio Lomurno and Matteo Matteucci},
journal= {arXiv preprint arXiv:2305.10118},
year = {2023}
}