模型的语言 matters:大语言模型的比较性隐私分析
计算与语言
2025-10-13 v1 密码学与安全
摘要
大型语言模型(LLM)正在跨语言应用中部署,处理敏感数据,但其规模和语言可变性带来了重大的隐私风险。虽然大多数研究仅针对英语进行评估,但本文探讨了语言结构如何影响在英语、西班牙语、法语和意大利语医学语料库上训练的 LLM 的隐私泄露。我们量化了六个语言指标,评估了三种攻击向量:提取、反事实记忆和成员推断。结果表明,隐私脆弱性随语言冗余度和分词粒度而增长:意大利语显示出最强的泄露,而英语表现出更高的成员可分离性。相比之下,法语和西班牙语表现出更大的韧性,由于其更高的形态学复杂度。总体而言,我们的发现提供了语言在隐私泄露中的第一个定量证据,凸显了在 LLM 部署中需要语言感知的隐私保护机制。
引用
@article{arxiv.2510.08813,
title = {The Model's Language Matters: A Comparative Privacy Analysis of LLMs},
author = {Abhishek K. Mishra and Antoine Boutet and Lucas Magnana},
journal= {arXiv preprint arXiv:2510.08813},
year = {2025}
}