中文

对抗性影响的形状:用持久同调刻画 LLM 潜在空间

机器学习 2026-04-27 v3 人工智能 计算几何 代数拓扑

摘要

大型语言模型(LLM)现有的可解释性方法主要捕获线性方向或孤立特征。这忽略了模型表示的高维、关系和非线性几何。我们应用持久同调(PH)来刻画对抗性输入如何重塑 LLM 内部表示空间的几何与拓扑。这种现象,特别是在操作上不同的攻击模式下考虑时,仍然知之甚少。我们在两种不同的攻击(间接提示注入和后门微调)下分析了六个模型(3.8B 到 70B 参数),并表明一致的拓扑特征始终存在。对抗性输入诱发拓扑压缩,其中潜在空间在结构上变得更简单,从多样的、紧凑的小尺度特征坍缩为更少的、主导的大尺度特征。该特征与架构无关,在网络早期出现,并且在各层之间具有高度区分性。通过量化激活点云和神经元级信息流的形状,我们的框架揭示了表示变化的几何不变量,补充了现有的线性可解释性方法。

关键词

引用

@article{arxiv.2505.20435,
  title  = {The Shape of Adversarial Influence: Characterizing LLM Latent Spaces with Persistent Homology},
  author = {Aideen Fay and Inés García-Redondo and Qiquan Wang and Haim Dubossarsky and Anthea Monod},
  journal= {arXiv preprint arXiv:2505.20435},
  year   = {2026}
}