中文

小样本数据集的合成数据生成以数据增强为手段

机器学习 2025-02-03 v1 人工智能 机器学习

摘要

健康研究中常见小型数据集,但当训练数据集规模较小时,机器学习模型的泛化性能往往不佳。为此,数据增强是一种可行方案。增强样本数量被视为一种正则化手段,可提升小型数据集的多样性,从而使其在未见数据上的表现更佳。我们发现,数据增强对以下情况的 datasets 能显著提升预后性能:样本数较少、基准 AUC 较小、分类变量基数较高、结果变量较平衡。目前,没有哪一种特定的生成模型始终能凌驼于其他模型之上。我们开发了一个决策支持模型,可用于指导分析师判断数据增强是否具有实用价值。对于七个小型应用数据集,经数据增强后,AUC 提升幅度介于 4.31%(AUC 从 0.71 提升至 0.75)至 43.23%(AUC 从 0.51 提升至 0.73)之间,平均相对提升为 15.55%,这表明数据增强对小型数据集具有显著的实际影响(p=0.0078)。增强后的数据集 AUC 高于仅做抽样的 AUC(p=0.016),增强后数据集的多样性也高于抽样后数据集的多样性(p=0.046)。

关键词

引用

@article{arxiv.2501.18741,
  title  = {Synthetic Data Generation for Augmenting Small Samples},
  author = {Dan Liu and Samer El Kababji and Nicholas Mitsakakis and Lisa Pilgram and Thomas Walters and Mark Clemons and Greg Pond and Alaa El-Hussuna and Khaled El Emam},
  journal= {arXiv preprint arXiv:2501.18741},
  year   = {2025}
}