中文

FairCauseSyn:面向因果公平性的 LLM 增强合成数据生成方法

机器学习 2025-06-25 v1 人工智能

摘要

合成数据生成通过生成模型基于真实数据创建数据。在健康应用中,在保持敏感属性公平性的前提下生成高质量数据,对实现公平结果至关重要。现有基于 GAN 和 LLM 的方法聚焦于反事实公平性,主要应用于金融和法律领域。因果公平性通过保留因果结构提供更全面的评估框架,但当前的合成数据生成方法在健康领域尚未予以考虑。为填补这一空白,我们开发了首个利用真实世界表格健康数据增强因果公平性的 LLM 增强合成数据生成方法。生成的数据在因果公平性指标上与真实数据相差不足 10%。当训练于因果公平预测器时,合成数据相较于真实数据可将敏感属性上的偏差降低 70%。本工作提升了公平合成数据的可获取性,支持公平的健康研究和医疗护理。

关键词

引用

@article{arxiv.2506.19082,
  title  = {FairCauseSyn: Towards Causally Fair LLM-Augmented Synthetic Data Generation},
  author = {Nitish Nagesh and Ziyu Wang and Amir M. Rahmani},
  journal= {arXiv preprint arXiv:2506.19082},
  year   = {2025}
}

备注

Accepted to IEEE EMBC 2025