在 Head-Conditioned Canaries 下审计推理痕迹记忆偏差 claims
机器学习
2026-05-20 v1 人工智能
摘要
对推理模型的非决策评估有时会显示旁路模式:答案侧看似已忘却,但模型自身的思考痕迹仍持续输出被遗忘内容,人们便将此差距视为权重仍记忆此内容的证据。我们对 DeepSeek-R1-Distill-Qwen-7B 进行审计,该模型使用 LoRA 记忆虚构作者并进行 NPO 非决策处理,同时以六 token 的 canary 头为条件。在一个随机种子下,用相同权重的短非-canary 前缀替换思考痕迹可使答案率下降幅度相当于旁路差距本身,无论该前缀是模仿训练模板还是非模仿。在第二个随机种子中,旁路差距缩小而非消失,替换方向相反,答案率回升至上限。正面的解析器-分割旁路差距本身并不足以识别隐藏的权重级记忆,也不足以排除其存在。在另一个 distillate 上,同一指标因解析器找不到闭合标签而改变符号。我们建议在标准审计之外,采用解码时模板替换作为一种低成本的 sanity check。
引用
@article{arxiv.2605.18891,
title = {Auditing Reasoning-Trace Memorization Claims after Unlearning with Head-Conditioned Canaries},
author = {Yanhang Li and Zhichao Fan and Zexin Zhuang},
journal= {arXiv preprint arXiv:2605.18891},
year = {2026}
}