Llama 3 模型反向攻击:从大型语言模型提取个人可识别信息
机器学习
2025-07-08 v1 人工智能
密码学与安全
摘要
大型语言模型(LLMs)已彻底改变自然语言处理领域,但其记忆训练数据的能力潜在出现显著隐私风险。本文研究针对 Llama 3.2 模型(Meta 开发的多语言 LLM)进行模型反向攻击。通过精心设计的查询,我们展示了可从模型中提取个人可识别信息(PII),包括密码、电子邮件地址和帐户号码。我们的发现表明,即使是较小的 LLM 也面临隐私攻击,凸显了需要强大防御措施的必要性。我们讨论了包括差分隐私和数据消毒在内的潜在缓解策略,并呼吁进一步研究面向隐私的机器学习技术。
引用
@article{arxiv.2507.04478,
title = {Model Inversion Attacks on Llama 3: Extracting PII from Large Language Models},
author = {Sathesh P. Sivashanmugam},
journal= {arXiv preprint arXiv:2507.04478},
year = {2025}
}