中文

基于多臂赌博机方法优化合成数据的训练

机器学习 2024-12-10 v1 计算机视觉与模式识别

摘要

监督式机器学习方法需要大规模训练数据集才能在实际中发挥良好效果。近期来,合成数据正在显示出巨大的潜力,被用作真实数据的补充。然而,仍有迫切需求来评估合成生成数据的可用性。为此,我们提出一种 novel 的UCB-based训练程序,结合动态可用性指标。我们提出的指标综合了合成图像的低层次和高层次信息,以及其对应的真实和合成数据集,超越了现有传统指标。通过利用UCB-based的动态方法,确保模型学习的持续提升。与其他方法不同,我们的方法能够有效适应机器学习模型状态的变化,考虑训练过程中训练样本的演变效用。我们表明,该指标是有效的,可用于根据可用性对合成图像进行排序。此外,我们提出了一种集成大语言模型(LLM)与Stable Diffusion以生成合成数据的 new attribute-aware bandit pipeline。定量结果表明,我们的方法可以提升广泛范围内监督式分类器的性能。值得注意的是,我们观察到与传统方法相比,分类准确率提升了最高可达10%,证明了该方法的有效性。我们的源代码、数据集和其他材料已公开于 https://github.com/A-Kerim/Synthetic-Data-Usability-2024。

关键词

引用

@article{arxiv.2412.05466,
  title  = {Multi-Armed Bandit Approach for Optimizing Training on Synthetic Data},
  author = {Abdulrahman Kerim and Leandro Soriano Marcolino and Erickson R. Nascimento and Richard Jiang},
  journal= {arXiv preprint arXiv:2412.05466},
  year   = {2024}
}