中文

面向不变潜在空间的语言模型反演视角

机器学习 2025-11-26 v1

摘要

语言模型反演 (LMI),即从输出中恢复隐藏提示词,是用户隐私和系统安全的一个具体威胁。我们将 LMI 重新表述为重用 LLM 自身的潜在空间,提出不变潜在空间假设 (ILSH):(1) 来自同一源提示词的多样化输出应保持一致的语义 (源不变性),且 (2) 输入-输出循环映射应在共享潜在空间内保持自我一致性 (循环不变性)。据此,我们提出 Inv^2A,将 LLM 视为不变解码器,仅学习轻量级的逆编码器,将输出映射到去噪伪表示。当多个输出可用时,它们在表示层进行稀疏拼接以增加信息密度。训练分为两个阶段:对比对齐 (源不变性) 和监督强化 (循环不变性)。可选的训练-free 邻域搜索可细化局部性能。在覆盖用户和系统提示情景的 9 个数据集上,Inv^2A 在 BLEU 分数上平均超过基线 4.77%4.77\%,同时减少了对大规模逆转语料的依赖。我们的分析进一步表明,常见的防御措施提供的保护有限,凸显了需要更强策略的必要性。本文涉及的源码和数据可在 https://github.com/yyy01/Invariant_Attacker 中找到。

关键词

引用

@article{arxiv.2511.19569,
  title  = {An Invariant Latent Space Perspective on Language Model Inversion},
  author = {Wentao Ye and Jiaqi Hu and Haobo Wang and Xinpeng Ti and Zhiqing Xiao and Hao Chen and Liyao Li and Lei Feng and Sai Wu and Junbo Zhao},
  journal= {arXiv preprint arXiv:2511.19569},
  year   = {2025}
}

备注

The Fortieth AAAI Conference on Artificial Intelligence (AAAI-26)