该检查点是否已被消融?一种双信号审计及其失败图谱
密码学与安全
2026-07-02 v1 人工智能
摘要
平台能否在部署前判断一个开放权重检查点的拒绝机制是否已被剥离?运行时防护措施无法做到:它们评估的是生成结果,而非模型工件本身。我们结合两种廉价的内部信号——参考锚定的激活拒绝间隙和基础模型到候选模型权重差异的权重恢复能量——形成一种无阈值的检查点审计。这两种信号呈负相关且标签互补:间隙提供拒绝特异性,权重能量提供召回率。在一个涵盖Qwen、DeepSeek-distilled Qwen、Llama和Gemma的273个检查点注册表上,它们的z分数之和以0.95的AUROC区分了57个公开的消融模型和37个良性微调、合并及指令微调模型,显著高于任一单独信号(0.84,0.90),并且经Youden校准的阈值可迁移到保留的模型家族,平衡准确率为0.89(FPR为0.11),仅漏掉57个中的4个。随后,我们按严重程度映射了两个失败:一个伪造的参考在无需训练的情况下规避了这两个轴(构造上ΔW=0,ρ=1),以及一个白盒所有者训练出一个超过阈值的检查点,同时该检查点仍保持防护不安全且连贯。该审计是有效的分诊工具,而非防篡改手段:它假定存在一个经认证的参考,并且其声明受限于我们评估所用的注册表。
引用
@article{arxiv.2607.01854,
title = {Has This Checkpoint Been Abliterated? A Two-Signal Audit and Its Failure Map},
author = {Gabriel Hurtado},
journal= {arXiv preprint arXiv:2607.01854},
year = {2026}
}
备注
13 pages, 3 figures