消除跨序列记忆痕迹的探针几何对齐
机器学习
2026-05-08 v3 人工智能
密码学与安全
神经与进化计算
摘要
近期攻击表明,大型语言模型的行为式忘记留下了可被对抗性探针恢复的内部痕迹。我们描述了这种保留位置并表明其可在不产生可测能力代价的情况下进行手术切除。我们的核心协议是leave-one-out 跨序列探针,用于测试记忆痕迹是否在 held-out 序列上具有普遍性。该痕迹是真实且在规模上保持一致的:在 Pythia-70M、GPT-2 medium 和 Mistral-7B 上分别为 +0.32、+0.19、+0.30;在 Pythia-70M 上,随机初始化控制在预训练签名达到峰值的最深层中折合为 -0.04。探针方向与召回因果可分离——投影后消除该痕迹本地化 (+0.44 -> -0.19),而行为召回几乎不变——且在自然记忆内容上训练的探针不对 fine-tuning 注入的机密进行分类,标志着两种表征上不同于的范式。我们然后引入探针几何对齐 (PGA),进行手术消除在每个深度沿探针的活跃读数方向进行对齐。PGA 在所有四个测试规模上将跨序列探针压制到随机机率以下(toy depth-4: 0.17;Pythia-70M: 0.07;Mistral-7B: 0.45;GPT-2 medium: 0.06 通过 MD-PGA k=2),且对六种对抗性探针变体保持稳健。针对在 PGA 处理后的激活上重新训练的攻击者,我们扩展 PGA 进行对抗性处理,在每个记忆相关深度消除重新拟合探针,同时保持五项零样本能力基准在每个任务内 2.8 个百分点以内(平均 {\Delta}acc = +0.2pp)。跨序列痕迹是预训练表征的一个真实、因果可分离、规模相关的属性——可通过每个深度单个秩一干预在不产生可测能力代价的情况下将其压制到随机机率以下。
引用
@article{arxiv.2605.01699,
title = {Probe-Geometry Alignment: Erasing the Cross-Sequence Memorization Signature Below Chance},
author = {Anamika Paul Rupa and Anietie Andy},
journal= {arXiv preprint arXiv:2605.01699},
year = {2026}
}