中文

使用 GPT-4 对表格数据中零样本隐私与效用权衡的初步探索

机器学习 2024-09-12 v1 密码学与安全

摘要

我们研究了大型语言模型(LLMs),特别是 GPT-4,在涉及表格数据中隐私与效用权衡场景下的应用。我们的方法包括将表格数据点转换为文本格式来提示 GPT-4,随后以零样本方式加入精确的脱敏指令。主要目标是对表格数据进行脱敏,使得现有的机器学习模型无法准确推断隐私特征,同时允许模型准确推断与效用相关的属性。我们探索了各种脱敏指令。值得注意的是,我们发现这种相对简单的方法所产生的性能,可与用于管理隐私与效用权衡的更复杂的对抗优化方法相媲美。此外,虽然这些提示成功地从现有机器学习模型的检测能力中掩盖了隐私特征,但我们观察到,仅靠这种掩盖并不一定满足一系列公平性指标。尽管如此,我们的研究表明了 LLMs 在遵循这些公平性指标方面的潜在有效性,并且我们的一些实验结果与成熟的对抗优化技术所取得的结果相一致。

关键词

引用

@article{arxiv.2404.05047,
  title  = {Initial Exploration of Zero-Shot Privacy Utility Tradeoffs in Tabular Data Using GPT-4},
  author = {Bishwas Mandal and George Amariucai and Shuangqing Wei},
  journal= {arXiv preprint arXiv:2404.05047},
  year   = {2024}
}

备注

8 pages, Paper accepted at 2024 IEEE International Joint Conference on Neural Networks (IJCNN)