中文

面向小规模与不平衡数据集的 GANsemble:合成微塑料数据的基线

机器学习 2024-05-02 v2 人工智能 计算机视觉与模式识别

摘要

人类摄入或吸入微塑料颗粒是一个日益令人担忧的问题。遗憾的是,当前使用机器学习来了解其潜在危害的研究方法因缺乏可用数据而受阻。深度学习技术尤其受到此类只有小规模或不平衡数据集可用领域的挑战。克服这一挑战通常涉及对代表性不足的类别进行过采样或对现有数据进行增强以提升模型性能。本文提出 GANsemble:一个将数据增强与条件生成对抗网络 连接起来以生成类别条件合成数据的双模块框架。首先,数据选择器模块通过搜索最佳数据增强策略来自动化增强策略选择。接着,cGAN 模块使用该策略训练 cGAN 以生成增强的合成数据。我们在一个小规模且不平衡的微塑料数据集上对 GANsemble 框架进行了实验。引入了 Microplastic-cGAN (MPcGAN) 算法,并在 Frechet Inception Distance (FID) 和 Inception Scores (IS) 方面建立了合成微塑料 数据的基线。我们还提供了合成微塑料过滤器 算法以提高生成 SYMP 的质量。此外,我们展示了在小规模微塑料数据集中通过结合增强的最佳过采样量以解决类别不平衡问题。据我们所知,本研究是生成式 AI 在合成创建微塑料数据方面的首次应用。

关键词

引用

@article{arxiv.2404.07356,
  title  = {GANsemble for Small and Imbalanced Data Sets: A Baseline for Synthetic Microplastics Data},
  author = {Daniel Platnick and Sourena Khanzadeh and Alireza Sadeghian and Richard Anthony Valenzano},
  journal= {arXiv preprint arXiv:2404.07356},
  year   = {2024}
}

备注

Accepted to the 37th Canadian Artificial Intelligence Conference (2024), 12 pages, 4 figures