HARMONIC:面向表格数据生成与隐私保护的 LLM 利用框架
机器学习
2024-08-07 v1 人工智能
计算与语言
密码学与安全
摘要
数据是推进深度学习的根本基础,尤其是以结构化格式呈现的表格数据,对建模非常有利。然而,即便在 LLM 时代,从敏感领域获取表格数据仍然是一个挑战,due to 隐私或版权 concerns。因此,探索如何有效利用 LLM 等模型生成真实且隐私保护的合成表格数据显得尤为紧迫。本文致力于探索 LLM 在表格数据合成与隐私保护中的应用,提出一种新型框架 HARMONIC,用于表格数据的生成与评估。在本框架的表格数据生成中,与依赖 continued 预训练的小规模 LLM 方法不同,我们探索大规模 LLM 通过 fine-tuning 来生成表格数据并增强隐私。基于 k 近邻算法的思想,构建 instruction fine-tuning 数据集,以激励 LLM 发现行与行之间的关系。随后通过 fine-tuning,训练 LLM 记住数据的格式和连接关系,而非数据本身,从而降低隐私泄露风险。在框架的评估部分,我们开发了用于 LLM 合成数据生成的特定隐私风险指标 DLT,以及用于下游 LLM 任务的性能评估指标 LLE。我们的实验发现,该表格数据生成框架在保持相当性能的同时实现了更好的隐私保护,进而证明了我们评估框架在 LLM 场景下对合成数据效果和隐私风险的有效性。
引用
@article{arxiv.2408.02927,
title = {HARMONIC: Harnessing LLMs for Tabular Data Synthesis and Privacy Protection},
author = {Yuxin Wang and Duanyu Feng and Yongfu Dai and Zhengyu Chen and Jimin Huang and Sophia Ananiadou and Qianqian Xie and Hao Wang},
journal= {arXiv preprint arXiv:2408.02927},
year = {2024}
}