中文

教 AI 模型进行网络钓鱼:从语言模型中窃取私人信息

密码学与安全 2024-03-05 v1 人工智能 计算与语言 机器学习

摘要

当大型语言模型在私人数据上进行训练时,可能会记忆并输出敏感信息,这对于隐私构成显著风险。本文提出了一种新的实用数据提取攻击,称为"神经网络钓鱼"。该攻击使对手能够针对在用户数据上训练的模型进行目标提取,成功率可达10%甚至最高达50%,可从模型中提取出信用卡号等敏感或可识别个人信息(PII)。该攻击假设对手仅能通过对用户数据结构的模糊先验知识,插入少量看似良好的句子到训练数据集中。

关键词

引用

@article{arxiv.2403.00871,
  title  = {Teach LLMs to Phish: Stealing Private Information from Language Models},
  author = {Ashwinee Panda and Christopher A. Choquette-Choo and Zhengming Zhang and Yaoqing Yang and Prateek Mittal},
  journal= {arXiv preprint arXiv:2403.00871},
  year   = {2024}
}

备注

ICLR 2024