中文

向量非中性:从导出的 LLM 表示中推断敏感信息——基于摘要生成的案例研究

计算与语言 2026-05-27 v1

摘要

大型语言模型(LLM)摘要系统可能将私有输入的紧凑向量表示传递给下游检索、监控、审计或分析工作流程。即使源文档受到访问限制,导出的向量仍可能在不同的访问控制下支持敏感信息推断,造成残余信息披露风险。我们以临床出院概述生成为高风险案例研究,使用电子健康记录(EHR)中记录的种族作为受控敏感标签审计。我们审计了系统可能保留或暴露给下游组件的两个制品:最终提示标记隐藏状态和均值池化提示表示。我们的结果表明,减少一种导出制品中案例研究敏感标签可恢复性,并不一定减少另一种制品的可恢复性。作为缓解措施案例研究,我们引入了 SurfaceLoRA,这是一种针对导出向量的、参数高效的微调方法,使用附加到指定导出向量上的梯度反转判别器。 在平衡的五向探针协议下,SurfaceLoRA 将 EHR 记录的种族可恢复性从针对性最终标记制品逐渐降低至随机水平,同时保持摘要实用性,但来自非针对性池化制品的可恢复性仍显著高于随机。这些发现表明,隐私审计和缓解应针对系统保留或暴露给下游组件的确切向量制品进行。

关键词

引用

@article{arxiv.2605.26433,
  title  = {Vectors Are Not Neutral: Sensitive-Information Inference from Exported LLM Representations in Summarization},
  author = {Weixin Liu and Bowen Qu and Juming Xiong and Congning Ni and Bradley A. Malin and Zhijun Yin},
  journal= {arXiv preprint arXiv:2605.26433},
  year   = {2026}
}

备注

30 pages, 2 figures; preprint