评估作为差分隐私数据生成器的 LLM 模拟器
机器学习
2026-04-20 v1 计算与语言
密码学与安全
摘要
基于 LLM 的模拟器为生成复杂的合成数据提供了一条有前景的路径,而传统的差分隐私 (DP) 方法在处理高维用户画像时面临困难。但 LLM 能否忠实地再现来自 DP 保护输入的统计分布?我们使用 PersonaLedger(一个智能体金融模拟器)对此进行评估,该模拟器以源自真实用户统计数据的 DP 合成人物画像为种子。我们发现 PersonaLedger 在欺诈检测效用上取得了令人鼓舞的结果(在 epsilon=1 时 AUC 为 0.70),但由于系统性的 LLM 偏差——学习到的先验覆盖了时间和人口统计特征的输入统计——表现出显著的分布漂移。在基于 LLM 的方法能够处理它们本可能擅长的更丰富的用户表示之前,必须解决这些失败模式。
引用
@article{arxiv.2604.15461,
title = {Evaluating LLM Simulators as Differentially Private Data Generators},
author = {Nassima M. Bouzid and Dehao Yuan and Nam H. Nguyen and Mayana Pereira},
journal= {arXiv preprint arXiv:2604.15461},
year = {2026}
}
备注
Submitted to ICLR 2026. 6 pages + appendix