中文

你能保密吗?语言模型写入中的非自愿信息泄露

密码学与安全 2026-05-12 v1 人工智能

摘要

语言模型在需要进行隔离的场景中部署:系统提示不应被披露,链式思维推理对用户而言是隐藏的,敏感数据通过共享上下文传递。我们测试模型是否能够将提示信息保存在其写入中。我们为每个模型提供一个秘密词,并指示其不要在写入中显示它,然后要求其编写故事。第二个模型尝试从故事中识别秘密词进行二元判别测试。尽管秘密词在任何输出中都不会出现文字,但我们测试的五个前沿模型都以主题选择、图像和场景等方式进行主题化泄露——泄露率显著不同于随机,最高可达79%。当被告知要主动隐藏秘密时,模型会"远离"该秘密,而这种规避本身就会被检测到。泄露具有跨模型可读性,在两个模型家族内部随模型大小而显著增大,但在短篇写作如笑话等情况下则完全消失。给出一个作为"目标代替品"的伪概念来"专注于取代",可部分地将泄露从真实秘密引向伪概念。关注某个秘密似乎会打开一个信息信道,前沿 LLM 即使在被指示隐藏时也无法关闭此信道。

关键词

引用

@article{arxiv.2605.10794,
  title  = {Can You Keep a Secret? Involuntary Information Leakage in Language Model Writing},
  author = {Ari Holtzman and Peter West},
  journal= {arXiv preprint arXiv:2605.10794},
  year   = {2026}
}