中文

Eguard:通过文本互信息优化防御 LLM 嵌入的反向攻击

密码学与安全 2025-11-20 v2 人工智能 计算与语言

摘要

嵌入向量因能够将文本数据转换为捕捉语义和语法属性的丰富、稠密数值表示,已成为大型语言模型(LLM)功能核心。这些嵌入向量数据库作为 LLM 的长期记忆,使其能够高效处理广泛的自然语言处理任务。然而,嵌入向量数据库在 LLM 中的流行激增伴随着显著的隐私泄露担忧。嵌入向量数据库尤其容易受到嵌入反向攻击的威胁,攻击者可利用嵌入向量从原始文本数据中提取出敏感信息。现有防御机制常常局限于在安全性与下游任务性能之间取得平衡。为此,我们引入 Eguard,一种新型防御机制,用于缓解嵌入反向攻击。Eguard 采用基于转换器的投影网络和文本互信息优化,旨在保护嵌入向量的同时保持 LLM 的实用性。我们的方法显著降低了隐私风险,在保持高性能的同时,保护了超过 95% 的 token 免受反向攻击。

关键词

引用

@article{arxiv.2411.05034,
  title  = {Eguard: Defending LLM Embeddings Against Inversion Attacks via Text Mutual Information Optimization},
  author = {Tiantian Liu and Hongwei Yao and Feng Lin and Tong Wu and Zhan Qin and Kui Ren},
  journal= {arXiv preprint arXiv:2411.05034},
  year   = {2025}
}