VortexPIA: 针对LLM隐私提取的间接提示注入攻击
密码学与安全
2025-10-07 v1
摘要
大型语言模型(LLM)已在对话型人工智能(CAI)中广泛部署,暴露出隐私和安全威胁。最近的研究表明,LLM-based CAI 能被操纵以提取人类用户的私人信息,构成严重的安全威胁。然而,该研究中提出的方法依赖于白盒环境,即攻击者可直接修改系统提示。这一条件在现实部署中不太可能成立。该限制提出了一个关键问题:在实际的LLM集成应用中,未获授权的攻击者是否仍能诱发此类隐私风险?为回答此问题,我们提出了\textsc{VortexPIA},一种针对黑盒环境下的LLM集成应用的新型间接提示注入攻击,旨在引发隐私提取。通过注入包含虚假记忆的高效 token 数据,\textsc{VortexPIA} 误导LLM主动以批量方式请求私人信息。与先前方法不同,\textsc{VortexPIA} 允许攻击者灵活定义多个敏感数据的类别。我们在六个LLM上进行评估,涵盖传统LLM和推理LLM,以及四个基准数据集。结果表明,\textsc{VortexPIA} 显著优于基线方法,实现了最先进(SOTA)性能。它还显示出高效的隐私请求、减少的 token 消耗以及对防御机制的增强鲁棒性。我们进一步在多个现实的开源LLM集成应用中验证了\textsc{VortexPIA} 的实际有效性。
引用
@article{arxiv.2510.04261,
title = {VortexPIA: Indirect Prompt Injection Attack against LLMs for Efficient Extraction of User Privacy},
author = {Yu Cui and Sicheng Pan and Yifei Liu and Haibin Zhang and Cong Zuo},
journal= {arXiv preprint arXiv:2510.04261},
year = {2025}
}