What do your logits know? (The answer may surprise you!)
人工智能
2026-04-14 v1
摘要
近期研究表明,探测模型内部信息可揭示大量模型生成表面上不可见的信息。这构成了意外或恶意信息泄露的风险,模型使用者可获取模型所有者原本认为无法获取的情报。以视觉语言模型为测试对象,本文首次系统比较了在压缩自残差流中信息保留情况,涉及两种自然瓶颈:一种是通过使用微调镜头获得的残差流的低维投影,另一种是最可能影响模型答案的最终 top-k logits。我们表明,即使是由模型 top logit 值定义的易于访问的瓶颈,也可泄露图像查询中任务无关的信息,在某些情况下,甚至可泄露与直接投影完整残差流相当的信息量。
引用
@article{arxiv.2604.09885,
title = {What do your logits know? (The answer may surprise you!)},
author = {Masha Fedzechkina and Eleonora Gualdoni and Rita Ramos and Sinead Williamson},
journal= {arXiv preprint arXiv:2604.09885},
year = {2026}
}