通过整合因果结构提高TabPFN的合成数据生成
机器学习
2026-03-12 v1
摘要
合成表格数据生成解决了数据稀缺和隐私限制在各种领域的问题。TabPFN是一种最近的表格数据基础模型,已显示出能够生成高质量合成表格数据的能力。然而,TabPFN是自回归的:特征按顺序生成,依据于它们在输入数据中的顺序。我们展示当特征顺序与因果结构冲突时,模型会产生虚假相关性,这会损害其生成合成数据和保持因果效应的能力。我们通过两种互补方法来解决这一限制:一种是基于有向无环图(DAG)的条件化方法,对每个变量给定其因果父母进行采样;另一种是基于已完成部分有向无环图(CPDAG)的策略,用于部分因果知识的情景。我们在受控基准测试和六个CSuite数据集上评估了这些方法,评估结构忠实性、分布对齐、隐私保护和平均处理效应(ATE)保持。 在大多数情况下,DAG感知条件化相对于vanilla TabPFN提高了合成数据的质量和稳定性。CPDAG-based方法显示出适度的改进,效果取决于已定向边的数量。这些结果表明,将因果结构注入自回归生成可提高合成表格数据的可靠性。
引用
@article{arxiv.2603.10254,
title = {Improving TabPFN's Synthetic Data Generation by Integrating Causal Structure},
author = {Davide Tugnoli and Andrea De Lorenzo and Marco Virgolin and Giovanni Cinà},
journal= {arXiv preprint arXiv:2603.10254},
year = {2026}
}
备注
8 pages main text, 30 pages total (including supplementary material), 27 figures. Code: https://github.com/DavideTugnoli/tabpfn-causal-synthetic