中文

小数据集的生成式扩张:一种扩展图方法

机器学习 2024-10-02 v2 计算机视觉与模式识别 图像与视频处理

摘要

机器学习中的数据稀缺性显著影响性能和泛化能力。传统数据增强方法只能提升中等充足的数据集。GAN在生成多样化样本时常面临收敛问题。虽然扩散模型效果显著,但计算成本高。我们提出一种扩写合成模型,用于从最小样本生成大规模、信息丰富的数据集。该模型使用扩写图映射和特征插值来保持数据分布和特征关系。该模型利用神经网络捕获的非线性潜在空间,通过Koopman算子实现线性特征空间,以便进行数据集扩张。带自注意力层和最优传输的自动编码器用于细化分布一致性。我们通过将在生成数据上训练的分类器与在原始数据集上训练的分类器进行比较来进行验证。结果表明,生成的数据集能实现相当的性能,证明了该模型在有效增强训练数据方面的潜力。该工作推动了数据生成技术,解决了机器学习应用中的数据稀缺问题。

关键词

引用

@article{arxiv.2406.17238,
  title  = {Generative Expansion of Small Datasets: An Expansive Graph Approach},
  author = {Vahid Jebraeeli and Bo Jiang and Hamid Krim and Derya Cansever},
  journal= {arXiv preprint arXiv:2406.17238},
  year   = {2024}
}

备注

5 pages, 3 figures and 2 tables. Under review in ICASSP 2025