中文

What do your logits know? (The answer may surprise you!)

人工智能 2026-04-14 v1

摘要

近期研究表明,探测模型内部信息可揭示大量模型生成表面上不可见的信息。这构成了意外或恶意信息泄露的风险,模型使用者可获取模型所有者原本认为无法获取的情报。以视觉语言模型为测试对象,本文首次系统比较了在压缩自残差流中信息保留情况,涉及两种自然瓶颈:一种是通过使用微调镜头获得的残差流的低维投影,另一种是最可能影响模型答案的最终 top-k logits。我们表明,即使是由模型 top logit 值定义的易于访问的瓶颈,也可泄露图像查询中任务无关的信息,在某些情况下,甚至可泄露与直接投影完整残差流相当的信息量。

关键词

引用

@article{arxiv.2604.09885,
  title  = {What do your logits know? (The answer may surprise you!)},
  author = {Masha Fedzechkina and Eleonora Gualdoni and Rita Ramos and Sinead Williamson},
  journal= {arXiv preprint arXiv:2604.09885},
  year   = {2026}
}