中文

数据稀缺情景下用于合成表格数据的人工归纳偏置

机器学习 2025-08-01 v2 人工智能

摘要

尽管使用深度生成模型(DGM)生成合成表格数据是解决数据稀缺和隐私问题的有力方法,但其效果依赖于大量训练数据的可用性,往往在现实场景中缺乏。为克服这一限制,我们提出了一种新方法,通过显式整合人工归纳偏置到生成过程中,以提高低数据 regime下的数据质量。我们的框架利用迁移学习和元学习技术构建和注入信息性归纳偏置到DGM中。我们评估了四种方法(预训练、模型平均、模型无关性元学习(MAML)和领域随机搜索(DRS)),并分析了其对生成文本质量的影响。实验结果表明,纳入归纳偏置显著提升了性能,其中迁移学习方法优于元学习方法,实现了最高可达60%的 Jensen-Shannon 散度提升。该方法具有模型无关性,尤其适用于数据可用性有限且需要高质量合成数据的医疗和金融等领域。

关键词

引用

@article{arxiv.2407.03080,
  title  = {Artificial Inductive Bias for Synthetic Tabular Data Generation in Data-Scarce Scenarios},
  author = {Patricia A. Apellániz and Ana Jiménez and Borja Arroyo Galende and Juan Parras and Santiago Zazo},
  journal= {arXiv preprint arXiv:2407.03080},
  year   = {2025}
}

备注

19 pages, 6 Figures