CuTS:可定制表格合成数据生成
机器学习
2024-06-04 v4 数据库
编程语言
摘要
隐私、数据质量和数据共享问题对表格数据应用构成了关键限制。虽然生成类似于原始分布的合成数据解决了其中部分问题,但大多数应用将受益于对生成数据的额外定制。然而,现有的合成数据方法局限于特定约束,例如差分隐私(DP)或公平性。本工作中,我们引入 CuTS,首个可定制的表格合成数据生成框架。CuTS 中的定制通过声明式统计与逻辑表达式实现,支持广泛的需求(例如 DP 或公平性等)。为确保存在定制规范时合成数据的高质量,CuTS 在原始数据集上预训练,并使用由所提供规范通过新颖松弛自动导出的可微损失进行微调。我们在四个数据集和众多定制规范上评估 CuTS,在多项任务上优于最先进的专用方法,同时具有更强的通用性。特别是在相同公平性水平下,我们在 Adult 数据集上比最先进的公平合成数据生成方法实现了高 2.3% 的下游准确率。
引用
@article{arxiv.2307.03577,
title = {CuTS: Customizable Tabular Synthetic Data Generation},
author = {Mark Vero and Mislav Balunović and Martin Vechev},
journal= {arXiv preprint arXiv:2307.03577},
year = {2024}
}