中文

AlignDP:面向大语言模型的混合差分隐私与稀有事件感知保护

密码学与安全 2025-12-22 v1 人工智能 机器学习

摘要

大语言模型面临提取、蒸馏和未授权微调等风险。现有防御方法采用水印或监控,但这些措施在信息泄露后才发挥作用。我们设计了 AlignDP,一种混合隐私锁,用于在数据接口处阻止知识传递。核心思想是将稀有字段与非稀有字段进行分离。稀有字段通过 PAC 可区分性获得有效零 epsilon 局部差分隐私,非稀有字段则采用 RAPPOR 进行隐私保护,在局部差分隐私下提供无偏的频率估计。全局聚合器 enforces 组合和预算。这种两层设计隐藏稀有事件,并对频繁事件添加受控噪声。我们证明了 PAC 扩展到全局聚合的限制,给出 RAPPOR 估计的下界,并分析了实用性权衡。 toy 模拟验证了可行性:稀有类别保持隐藏,频繁类别以较小误差恢复。

关键词

引用

@article{arxiv.2512.17251,
  title  = {AlignDP: Hybrid Differential Privacy with Rarity-Aware Protection for LLMs},
  author = {Madhava Gaikwad},
  journal= {arXiv preprint arXiv:2512.17251},
  year   = {2025}
}

备注

39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: LOCK-LLM Work-shop, NeurIPS 2025