教 AI 模型进行网络钓鱼:从语言模型中窃取私人信息
密码学与安全
2024-03-05 v1 人工智能
计算与语言
机器学习
摘要
当大型语言模型在私人数据上进行训练时,可能会记忆并输出敏感信息,这对于隐私构成显著风险。本文提出了一种新的实用数据提取攻击,称为"神经网络钓鱼"。该攻击使对手能够针对在用户数据上训练的模型进行目标提取,成功率可达10%甚至最高达50%,可从模型中提取出信用卡号等敏感或可识别个人信息(PII)。该攻击假设对手仅能通过对用户数据结构的模糊先验知识,插入少量看似良好的句子到训练数据集中。
引用
@article{arxiv.2403.00871,
title = {Teach LLMs to Phish: Stealing Private Information from Language Models},
author = {Ashwinee Panda and Christopher A. Choquette-Choo and Zhengming Zhang and Yaoqing Yang and Prateek Mittal},
journal= {arXiv preprint arXiv:2403.00871},
year = {2024}
}
备注
ICLR 2024