FairTabGen:基于有限样本的高保真且公平的合成健康数据生成
机器学习
2026-02-19 v2 人工智能
摘要
合成医疗数据的生成为解决临床研究中因隐私和监管限制而导致的研究局限性提供了一种有前景的方案。然而,当前的合成数据生成方法需要关于训练生成模型的专门知识,并且需要较高的计算资源。在本文中,我们提出了 FairTabGen,一个基于大语言模型的表格数据生成框架,仅使用原始数据集的一小部分子集即可生成高质量的合成医疗数据。我们的方法结合了上下文学习、提示词策展和嵌入结构约束来进行数据合成。我们在 MIMIC-IV 数据集上评估了性能。我们的方法使用的数据减少了 99%,并通过无意识公平性实现了 50% 的公平性提升,同时保持了具有竞争力的预测效用。然而,我们观察到种族群体的数据分布存在偏差,影响了人口统计均等性。随后,我们在预处理阶段应用了偏差缓解算法,将整体公平性提高了 10%,凸显了我们方法的有效性。
引用
@article{arxiv.2508.11810,
title = {FairTabGen: High-Fidelity and Fair Synthetic Health Data Generation from Limited Samples},
author = {Nitish Nagesh and Salar Shakibhamedan and Mahdi Bagheri and Ziyu Wang and Nima TaheriNejad and Axel Jantsch and Amir M. Rahmani},
journal= {arXiv preprint arXiv:2508.11810},
year = {2026}
}