中文

大语言模型是否内部知道什么是私有的?探测和引导大语言模型表征中的语境隐私规范

计算与语言 2026-04-02 v1

摘要

大语言模型(LLMs)越来越多地被部署在高风险场景中,但它们经常违反语境隐私,在人类会行使审慎判断的情况下披露私人信息。这提出了一个基本问题:大语言模型是否在内部编码了语境隐私规范,如果是,为什么违规行为仍然持续?我们首次将语境隐私作为LLMs中的结构化潜在表征进行系统研究,以语境完整性(CI)理论为基础。对多个模型的探测表明,决定规范的三项CI参数(信息类型、接收者和传输原则)在激活空间中被编码为线性可分且功能独立的方向。尽管存在这种内部结构,模型在实践中仍然泄露私人信息,揭示了概念表征与模型行为之间的明显差距。为了弥合这一差距,我们引入了CI参数化引导,沿每个CI维度独立进行干预。这种结构化控制比整体引导更有效且更可预测地减少了隐私违规。我们的结果表明,语境隐私失败源于表征与行为之间的不对齐,而非缺乏意识,利用CI的组合结构可以实现更可靠的语境隐私控制,为潜在改善LLMs中的语境隐私理解提供了启示。

关键词

引用

@article{arxiv.2604.00209,
  title  = {Do LLMs Know What Is Private Internally? Probing and Steering Contextual Privacy Norms in Large Language Model Representations},
  author = {Haoran Wang and Li Xiong and Kai Shu},
  journal= {arXiv preprint arXiv:2604.00209},
  year   = {2026}
}