中文

通过整合因果结构提高TabPFN的合成数据生成

机器学习 2026-03-12 v1

摘要

合成表格数据生成解决了数据稀缺和隐私限制在各种领域的问题。TabPFN是一种最近的表格数据基础模型,已显示出能够生成高质量合成表格数据的能力。然而,TabPFN是自回归的:特征按顺序生成,依据于它们在输入数据中的顺序。我们展示当特征顺序与因果结构冲突时,模型会产生虚假相关性,这会损害其生成合成数据和保持因果效应的能力。我们通过两种互补方法来解决这一限制:一种是基于有向无环图(DAG)的条件化方法,对每个变量给定其因果父母进行采样;另一种是基于已完成部分有向无环图(CPDAG)的策略,用于部分因果知识的情景。我们在受控基准测试和六个CSuite数据集上评估了这些方法,评估结构忠实性、分布对齐、隐私保护和平均处理效应(ATE)保持。 在大多数情况下,DAG感知条件化相对于vanilla TabPFN提高了合成数据的质量和稳定性。CPDAG-based方法显示出适度的改进,效果取决于已定向边的数量。这些结果表明,将因果结构注入自回归生成可提高合成表格数据的可靠性。

关键词

引用

@article{arxiv.2603.10254,
  title  = {Improving TabPFN's Synthetic Data Generation by Integrating Causal Structure},
  author = {Davide Tugnoli and Andrea De Lorenzo and Marco Virgolin and Giovanni Cinà},
  journal= {arXiv preprint arXiv:2603.10254},
  year   = {2026}
}

备注

8 pages main text, 30 pages total (including supplementary material), 27 figures. Code: https://github.com/DavideTugnoli/tabpfn-causal-synthetic