基于扩散模型的合成表格数据会员推断挑战
机器学习
2026-05-14 v2
摘要
合成数据常被视为数据匿名化和隐私保留数据发布的银弹解决方案。基于扩散模型等生成模型创建的合成数据预期在保留原始数据集统计特性的同时,抵御隐私攻击。近期扩散模型在广泛的数据类型上效果显著,但其针对表格格式数据的隐私韧性尚未得到广泛探讨。MIDST 挑战旨在量化评估由扩散模型生成的合成表格数据的隐私收益,特别关注其对会员推断攻击(MIAs)的抵抗力。鉴于表格数据的异质性和复杂性,探索了多种目标模型用于 MIAs,包括针对混合数据类型单表格和带有相互约束关系的多关系表格的扩散模型。MIDST 挑战催生了针对这些目标扩散模型的新型黑盒和白盒 MIAs,以实现对其隐私效能的全面评估。MIDST GitHub 仓库地址为 https://github.com/VectorInstitute/MIDST
引用
@article{arxiv.2603.19185,
title = {MIDST Challenge at SaTML 2025: Membership Inference over Diffusion-models-based Synthetic Tabular data},
author = {Masoumeh Shafieinejad and Xi He and Mahshid Alinoori and John Jewell and Sana Ayromlou and Wei Pang and Veronica Chatrath and Gauri Sharma and Deval Pandya},
journal= {arXiv preprint arXiv:2603.19185},
year = {2026}
}
备注
4 page, 1 table