中文

特征到图像的数据增强:利用聚类引导的合成样本改进模型特征提取

人工智能 2025-04-25 v2 机器学习

摘要

机器学习的一个增长趋势是使用数据生成技术,因为机器学习模型的性能依赖于训练数据集的数量。然而,在许多现实世界应用中,尤其是在医疗和低资源领域,由于资源限制,收集大型数据集具有挑战性,这会导致过拟合和泛化能力差。本研究引入了 FICAug,一种新颖的特征到图像数据增强框架,旨在通过生成结构化的合成样本来改善有限数据条件下的模型泛化能力。FICAug 首先在特征空间中操作,使用 k-means 算法对原始数据进行聚类。在纯标签聚类内,通过高斯采样生成合成数据,以增加多样性同时保持标签一致性。然后,使用生成式神经网络将这些合成特征投影回图像域,并在重建的图像上训练卷积神经网络以学习增强的表示。实验结果表明,FICAug 显著提高了分类准确率。在特征空间中,它达到了 84.09% 的交叉验证准确率,而在重构图像上训练 ResNet-18 模型进一步将性能提升至 88.63%,这说明了所提框架在提取新的、与任务相关的特征方面的有效性。

关键词

引用

@article{arxiv.2409.17685,
  title  = {Feature-to-Image Data Augmentation: Improving Model Feature Extraction with Cluster-Guided Synthetic Samples},
  author = {Yasaman Haghbin and Hadi Moradi and Reshad Hosseini},
  journal= {arXiv preprint arXiv:2409.17685},
  year   = {2025}
}

备注

10 pages, 6 figures, 6 table