中文

推理时优化消除表格扩散模型中的合成-真实差距

机器学习 2026-05-08 v1 人工智能

摘要

基于扩散的生成器为合成表格数据设定了当前的 SOTA。这些方法接近但很少超过真实数据的效用,并且迄今为止,消除这种合成-真实差距完全是在训练时通过架构改进、扩展和重新训练单体生成器来实现的。推理时的替代方案,即在保持参数不变的情况下优化预训练骨干网络的输出,在表格合成领域很大程度上仍未被探索。我们引入了 TARDIS(通过优化、蒸馏和推理时采样进行表格生成),这是一个推理时优化框架,它在冻结的预训练骨干网络上运行,通过在逆向扩散过程中对分数级引导进行 Tree-structured Parzen Estimator 搜索来针对每个数据集进行配置,每次试验的目标由事后样本选择器的内部网格搜索和可选的软标签蒸馏步骤设定。搜索空间编码了我们命名为双向 Chamfer 优化 (Bidirectional Chamfer Refinement, BCR) 的单一数学模式:合成样本与真实样本之间的对称 Chamfer 泛函既通过分数级梯度连续最小化,也通过生成后批量排名离散最小化。针对每个数据集的搜索在大多数数据集上恢复了与 BCR 对齐的配置,这证明了 BCR 是主导的优化模式。在 15 个二元、多类和回归基准上,与在真实数据上训练的模型相比,TARDIS 实现了中位数 +8.6% 的下游任务改进(95% CI [+3.3, +16.4],Wilcoxon p=0.016,15 个中有 11 个严格胜出),并且在所有 15 个数据集上优于 TabDiff 骨干网络(平均 +12.9%,p<10^-4),同时在流形保真度、多样性和样本级隐私上与骨干网络匹配。在单个消费级 GPU 上,预训练表格扩散骨干网络的推理时优化在 1 到 80 分钟内达到并超过了真实数据的效用。

关键词

引用

@article{arxiv.2605.06261,
  title  = {Inference-Time Refinement Closes the Synthetic-Real Gap in Tabular Diffusion},
  author = {Eugenio Lomurno and Filippo Balzarini and Francesco Benelle and Francesca Pia Panaccione and Matteo Matteucci},
  journal= {arXiv preprint arXiv:2605.06261},
  year   = {2026}
}