面积化解释:架构混淆下的可解释性
密码学与安全
2025-06-24 v1 人工智能
摘要
架构混淆——例如置换隐藏状态张量、对嵌入表进行线性变换或重新映射标记——最近因作为面向大型语言模型(LLM)推理的轻量级隐私保护替代方案而受到关注。虽然最近的研究表明,这些技术在专门的重建攻击下可能被破解,但其对机制可解释性的影响尚未系统地加以研究。特别是,仍不清楚的是,对网络内部表征的置换是否真正阻止了理解模型工作方式的努力,还是仅仅将相同的电路 relocate 到一个不熟悉的坐标系中。我们通过分析一个从头训练的 GPT-2-small 模型,该模型采用代表性的混淆映射。假设混淆映射是私有的且原始基底被隐藏(模拟诚实但好奇的服务器),我们应用 logit-lens 归因、因果路径修补和注意力头消除来定位和操纵已知的电路。我们的发现表明,混淆显著改变注意力头中的激活模式,但保留了分层计算图。这种分离阻碍了用户提示的逆向工程:因果痕迹失去与基线语义的对齐,标记级 logit 归因变得过于噪声化,无法重建。与此同时,前馈和残差通路保持功能完整,这表明混淆削弱了细粒度可解释性而不损害顶层任务性能。这一结果为量化证据表明,架构混淆可以同时(i)保持全局模型行为,(ii)阻碍对用户特定内容的机制分析。通过描绘可解释性何时失效的地方,我们的研究为未来的隐私防御及稳健性感知的可解释性工具提供了指导。
引用
@article{arxiv.2506.18053,
title = {Mechanistic Interpretability in the Presence of Architectural Obfuscation},
author = {Marcos Florencio and Thomas Barton},
journal= {arXiv preprint arXiv:2506.18053},
year = {2025}
}