中文

深度层次误导隐私感知:LLM 内部状态反向推理

密码学与安全 2025-07-23 v1 人工智能

摘要

大型语言模型(LLM)日益融入日常生活,却引发显著隐私与安全担忧。近期研究提出协同推理方案,将早期层推理外包以确保数据局部性,同时基于内部神经元模式引入模型安全审计。这些技术暴露了LLM的内部状态(ISs),传统认为因优化难题及深层抽象表征而难以从输入中逆转。本文挑战这一假设,提出四种反向推理攻击显著提升 inverted inputs 的语义相似度与token匹配率。具体而言,我们首先针对低深度与高深度 ISs 开发两种基于白盒优化的攻击,这些攻击通过双阶段反向推理过程规避局部最小值的收敛——这是先前研究中观察到的局限。随后,我们在更实用的黑盒权重访问条件下将优化攻击扩展,利用源模型与导出LLM之间的可迁移性。此外,我们引入一种基于生成的攻击,将反向推理视为翻译任务,采用 inversion model 来重构输入。对医学咨询与编码辅助数据集中的短文本与长文本以及6种LLM进行了广泛评估,验证了 our inversion attacks 的有效性。值得注意的是,4112字的医学咨询提示可从Llama-3模型中层几乎完美地被逆转,token匹配F1达86.88。最后,我们评估了四种实际防御措施,发现无法完美防止 ISs 反向推理,并得出针对未来防御设计的结论。

关键词

引用

@article{arxiv.2507.16372,
  title  = {Depth Gives a False Sense of Privacy: LLM Internal States Inversion},
  author = {Tian Dong and Yan Meng and Shaofeng Li and Guoxing Chen and Zhen Liu and Haojin Zhu},
  journal= {arXiv preprint arXiv:2507.16372},
  year   = {2025}
}

备注

Accepted by USENIX Security 2025. Please cite this paper as "Tian Dong, Yan Meng, Shaofeng Li, Guoxing Chen, Zhen Liu, Haojin Zhu. Depth Gives a False Sense of Privacy: LLM Internal States Inversion. In the 34th USENIX Security Symposium (USENIX Security '25)."