中文

通过语言特定与通用隐私神经元理解并缓解跨语言隐私泄露

计算与语言 2025-06-10 v2

摘要

在海量数据上训练的大型语言模型(LLM)捕获了训练数据中蕴含的丰富信息。然而,这也引入了隐私泄露的风险,特别是涉及个人身份信息(PII)。尽管先前的研究表明可以通过隐私神经元等方法缓解这种风险,但它们都假设(敏感的)训练数据和用户查询均为英文。我们表明它们无法防御跨语言语境下的隐私泄露:即使训练数据完全使用一种语言,这些(私有)模型在以另一种语言查询时仍可能泄露私人信息。在这项工作中,我们首先研究跨语言隐私泄露的信息流,以提供更好的理解。我们发现LLM在中间层处理私人信息,这些层的表征在不同语言间高度共享。当在后续层转换为语言特定空间时,泄露风险达到峰值。基于此,我们识别出隐私通用神经元和语言特定隐私神经元。隐私通用神经元影响所有语言的隐私泄露,而语言特定隐私神经元仅与特定语言相关。通过停用这些神经元,跨语言隐私泄露风险降低了23.3%-31.6%。

关键词

引用

@article{arxiv.2506.00759,
  title  = {Understanding and Mitigating Cross-lingual Privacy Leakage via Language-specific and Universal Privacy Neurons},
  author = {Wenshuo Dong and Qingsong Yang and Shu Yang and Lijie Hu and Meng Ding and Wanyu Lin and Tianhang Zheng and Di Wang},
  journal= {arXiv preprint arXiv:2506.00759},
  year   = {2025}
}