中文

VectorSmuggle:嵌入存储中的隐写术外泄及其加密来源防御

密码学与安全 2026-05-14 v1 信息检索 机器学习

摘要

现代检索增强生成(RAG)系统将敏感内容转换为高维嵌入并存储在向量数据库中,这些数据库将生成的数值artifact视为不可见。主要的向量存储产品未提供嵌入完整性的本地控制、 ingestion-time分布性异常检测或加密来源证明。我们展示这为一类隐写术外泄攻击打开了可能性:拥有写入权限以写入管道的攻击者可通过简单的嵌入后扰动(噪声注入、旋转、缩放、偏移、碎片化等)隐藏有效载荷数据,同时保持RAG系统向合法用户暴露的表面级检索行为。在合成PII语料库上进行评估,使用text-embedding-3-large、四个本地托管的开源嵌入模型、跨语料库复制的BEIR NFCorpus和一个Quora子集(共超过26,000个块)、七种向量存储配置、一个自适应攻击者变体的检测器评估,以及一个 paraphrased-query检索基准。分布性偏移扰动常被简单异常检测器捕获;小角度正交旋转在每个(model,语料)对测试中都能击败基于分布的检测。离散Givens旋转编码器给出了一个闭形式的每向量容量上限为floor(d/2)*b位,但实际嵌入流形施加了容量-可检测性权衡,检索保持的运行点位于其以下。我们提出VectorPin,一种加密来源协议,通过对每个嵌入及其来源内容和生成模型的规范字节表示进行Ed25519签名来锁定嵌入。任何嵌入后修改都会破坏签名验证。嵌入级别的完整性是一种可部署的、可标准化的控制,关闭了此类攻击。

关键词

引用

@article{arxiv.2605.13764,
  title  = {VectorSmuggle: Steganographic Exfiltration in Embedding Stores and a Cryptographic Provenance Defense},
  author = {Jascha Wanger},
  journal= {arXiv preprint arXiv:2605.13764},
  year   = {2026}
}

备注

47 pages, 3 figures. Reference implementations: https://github.com/jaschadub/VectorSmuggle and https://github.com/jaschadub/VectorPin