一种在真实世界数据极度匮乏条件下生成数据以训练机器学习模型的新算法
机器学习
2023-05-03 v1 神经与进化计算
摘要
训练机器学习模型需要大型数据集。然而,收集、整理和使用大型复杂真实世界数据集面临成本、伦理与法律问题以及数据可用性等困难。本文提出一种新算法,可在真实世界数据极度匮乏的条件下生成大型人工数据集以训练机器学习模型。该算法基于遗传算法,对随机生成的数据集进行变异,随后将其用于训练神经网络。训练后,神经网络在一批真实世界数据上的性能被视为其所用生成数据集适应度的代理。随着选择压力作用于生成数据集种群,不适个体被丢弃,最适个体的适应度逐代提升。该数据生成算法的性能在 Iris 数据集与 Breast Cancer Wisconsin 诊断数据集上进行了度量。在真实世界数据充足条件下,基于生成数据训练的机器学习模型平均准确率与基于真实世界数据训练的模型相当(Iris 数据集上两者均为 0.956,p = 0.6996;Breast Cancer 数据集上为 0.9377 对 0.9472,p = 0.1189)。在模拟真实世界数据极度匮乏条件下,基于生成数据训练的模型平均准确率显著高于基于稀缺真实世界数据训练的可比模型(Iris 数据集上 0.9533 对 0.9067,p < 0.0001;Breast Cancer 数据集上 0.8692 对 0.7701,p = 0.0091)。总之,该新算法可在真实世界数据极度匮乏,或因成本或数据敏感性而无法收集大型真实世界数据集的情况下,生成大型人工数据集以训练机器学习模型。
引用
@article{arxiv.2305.00987,
title = {A novel algorithm can generate data to train machine learning models in conditions of extreme scarcity of real world data},
author = {Olivier Niel},
journal= {arXiv preprint arXiv:2305.00987},
year = {2023}
}
备注
4 figures, 3 tables, 12 references, 3850 words