面向隐私硬化和抗幻觉的合成数据生成——基于逻辑求解器
人工智能
2024-10-23 v1 密码学与安全
计算机与社会
机器学习
摘要
机器生成数据是训练人工智能算法、评估稀有工作流程以及遵循更严格数据法规进行数据共享的宝贵资源。挑战在于生成准确且私密的数据。当前的统计方法和深度学习方法在大规模数据方面难以应对,容易产生与现实不相容的场景,且很少对隐私进行有意义的量化。本文引入了 Genomator,一种逻辑求解方法 (SAT 求解),高效地产生原始数据的私密且逼真的表示。我们在基因组数据上进行演示,这些数据或许是最复杂且最私密的信息。合成基因组具有潜在的价值,用于在医学研究中平衡欠代表的群体,并推动全球数据交换。我们将 Genomator 与最新方法 (马尔可夫生成、受限玻尔兹曼机、生成对抗网络和条件受限玻尔兹曼机) 进行基准测试,显示出 84-93% 的准确率提升和 95-98% 的隐私提高。Genomator 也快 1000-1600 倍,使其成为唯一能扩展到整个基因组的方法。我们展示了隐私与准确率之间的普遍权衡,并利用 Genomator 的调优功能满足整个谱系应用,从可证明的敏感队列表示,到不可区分的药物基因组轮廓数据集。生产规模的可调合成数据生成可增加信任,并为临床实践铺路。
引用
@article{arxiv.2410.16705,
title = {Privacy-hardened and hallucination-resistant synthetic data generation with logic-solvers},
author = {Mark A. Burgess and Brendan Hosking and Roc Reguant and Anubhav Kaphle and Mitchell J. O'Brien and Letitia M. F. Sng and Yatish Jain and Denis C. Bauer},
journal= {arXiv preprint arXiv:2410.16705},
year = {2024}
}