中文

ALGEN:利用对齐与生成进行文本嵌入的少样本逆攻击

密码学与安全 2025-02-19 v2 人工智能 计算与语言

摘要

随着大语言模型(LLM)和向量数据库的日益普及,私有文本数据越来越多地被处理和存储为数值嵌入。然而,最近的研究已证明此类嵌入容易受到逆攻击,即重构原始文本以揭示敏感信息。此前的研究大多假设可以访问数百万个句子来训练攻击模型,例如通过数据泄露或几乎不受限制的 API 访问。使用我们的方法,单个数据点就足以实现部分成功的逆攻击。仅需 1k 个数据样本,性能即可在一系列黑盒编码器上达到最优,而无需在泄露数据上进行训练。我们提出了一种利用对齐与生成的少样本文本嵌入逆攻击(ALGEN),通过将受害者嵌入对齐到攻击空间,并使用生成模型重构文本。我们发现 ALGEN 攻击可以有效跨领域和语言迁移,揭示关键信息。我们进一步考察了针对 ALGEN 的多种防御机制,发现均无效,突显了逆攻击带来的脆弱性。通过显著降低逆攻击的成本并证明嵌入空间可通过一步优化实现对齐,我们建立了一种新的文本嵌入逆攻击范式,其在嵌入对齐的 NLP 应用中具有更广泛的适用性。

关键词

引用

@article{arxiv.2502.11308,
  title  = {ALGEN: Few-shot Inversion Attacks on Textual Embeddings using Alignment and Generation},
  author = {Yiyi Chen and Qiongkai Xu and Johannes Bjerva},
  journal= {arXiv preprint arXiv:2502.11308},
  year   = {2025}
}

备注

18 pages, 13 tables, 6 figures