TABFAIRGDT:基于自回归决策树的快速公平表格数据生成器
机器学习
2025-09-25 v1 人工智能
摘要
在机器学习中确保公平性仍是一个重要挑战,因为模型常常继承训练数据的偏见。生成模型最近作为一种在数据层面缓解偏见同时保持效用的有前景的方法。然而,许多方法依赖深度架构,尽管已有证据表明更简单的模型对表格数据可以非常有效。本文引入TABFAIRGDT,一种用于生成公平合成表格数据的新方法,基于自回归决策树。为实现公平性,我们提出一种软叶子重抽样技术,通过调整决策树输出来减少偏见同时保持预测性能。我们的做法是非参数的,能够有效捕捉混合特征类型之间的复杂关系,不依赖于对底层数据分布的假设。我们在公平基准数据集上评估TABFAIRGDT,证明其优于最新深度生成模型,实现更好的公平性-效用权衡以及更高的合成数据质量。此外,我们的方法轻量级、高度高效且兼容CPU,无需数据预处理。惊人的是,TABFAIRGDT在各种数据集大小下均比最快的SOTA基线快72%,在标准CPU上仅需一秒即可为具有10个特征、10K样本的中等数据集生成公平合成数据,使其成为现实世界公平性敏感应用的理想解决方案。
引用
@article{arxiv.2509.19927,
title = {TABFAIRGDT: A Fast Fair Tabular Data Generator using Autoregressive Decision Trees},
author = {Emmanouil Panagiotou and Benoît Ronval and Arjun Roy and Ludwig Bothmann and Bernd Bischl and Siegfried Nijssen and Eirini Ntoutsi},
journal= {arXiv preprint arXiv:2509.19927},
year = {2025}
}
备注
Paper accepted at IEEE ICDM 2025: IEEE International Conference on Data Mining 2025, November 12-15, 2025, Washington DC, USA