TabStruct:衡量表格数据结构保真性
机器学习
2026-03-06 v2
摘要
评估表格生成器仍是一个具有挑战性的问题,因为异构表格数据的独特因果结构先验难以适用于直观的人类检查。近期研究引入了结构保真性作为表格数据特有的评估维度,以评估合成数据是否符合真实数据的因果结构。然而,现有基准常常忽略结构保真性与常规评估维度之间的相互作用,从而无法提供对模型性能的整体理解。此外,这些基准通常仅限于 toy 数据集,因为量化现有结构保真性指标需要获取真实的因果结构,而这在现实世界数据集中很少可用。本文提出了一种新型评估框架,联合考虑结构保真性与常规评估维度。我们引入了新的评估指标 (全局实用性),以便即使在缺乏真实因果结构的情况下也能评估结构保真性。此外,我们呈现了 ,一个综合性的评估基准,涵盖 13 个表格生成器来自 9 个不同类别的大规模定量分析,跨 29 个数据集。我们的结果表明,全局实用性为表格生成器的性能提供了一个与任务无关、领域无关的视角。我们发布了 TabStruct 基准套件,包括所有数据集、评估管道以及原始结果。代码地址为 https://github.com/SilenceX12138/TabStruct。
引用
@article{arxiv.2509.11950,
title = {TabStruct: Measuring Structural Fidelity of Tabular Data},
author = {Xiangjian Jiang and Nikola Simidjievski and Mateja Jamnik},
journal= {arXiv preprint arXiv:2509.11950},
year = {2026}
}
备注
Accepted by the Fourteenth International Conference on Learning Representations (ICLR 2026 Oral)