中文

语言识别与生成的隐私代价

机器学习 2026-04-09 v1 计算与语言 密码学与安全 数据结构与算法

摘要

随着大型语言模型(LLM)越来越多地在敏感用户数据上进行训练,理解语言学习中的基本隐私代价变得至关重要。我们在不可知统计设定下开创性地研究了差分隐私(DP)语言识别与生成,建立了算法及匹配的下界以精确量化隐私代价。对于两项任务,常数ε>0的近似(ε,δ)-DP恢复了非隐私的错误率:识别为exp(-r(n))(对任意r(n)=o(n)),生成为exp(-Ω(n))。在纯ε-DP下,指数以min{1,ε}为乘法因子退化,我们证明这在常数因子意义下是紧的。值得注意的是,在纯DP下且在温和假设下,生成的上界exp(-min{1,ε}·Ω(n))在常数因子的意义下与下界匹配,建立了最优速率。我们的结果表明,语言学习中的隐私代价出人意料地温和:在近似DP下完全不存在,在纯DP下指数中恰好为min{1,ε}因子。

关键词

引用

@article{arxiv.2604.07238,
  title  = {On the Price of Privacy for Language Identification and Generation},
  author = {Xiaoyu Li and Andi Han and Jiaojiao Jiang and Junbin Gao},
  journal= {arXiv preprint arXiv:2604.07238},
  year   = {2026}
}