解读微调先验:通过对比解码差异实现逐字内容恢复
机器学习
2026-05-26 v1
摘要
经过窄域微调的语言模型会逐字记忆植入的内容,但在无法访问其权重或训练数据的情况下,审计已部署模型被教授了什么内容,仍然是一个开放的挑战。最近的研究表明,基础模型与微调模型之间的激活差异携带着可读的微调领域痕迹;最先进的激活差异透镜(ADL)可以恢复模糊的领域级描述,但需要完全“白盒”访问模型内部。我们引入了对比解码差异(CDD),这是一种模型差异分析方法,仅对输出级别的logit分布进行操作,无需权重访问、无需层选择、也无需针对每个模型进行调优,却能恢复植入的事实。CDD包含三个思想:绕过聊天模板以暴露原始的微调先验,用最大模糊的预填充来引导生成,以及在每个解码步骤放大微调模型与基础模型在logit空间中的差异。一个单一的默认配置即可逐字恢复植入的事实——精确的药物名称、投票计数、物理测量值和程序细节——跨越四种架构(1B-32B参数),尽管访问权限更少且运行速度快约170倍,但性能全面优于ADL。此外,CDD还揭示了意外的数据流水线伪影:由LLM数据生成器通过模式崩溃引入的虚构角色泄露到了模型权重中,并被CDD提取出来,据我们所知,这构成了首个端到端的、从数据生成器伪影到模型权重再到恢复输出的指纹识别链。我们在真实领域微调设置上进行了验证,在所有单数据集非思维链变体上实现了近乎完美的恢复,并在混合数据集设置中正确识别了所有四个数据集。CDD作为一种灰盒方法,其性能优于白盒基线,这突显了其在AI系统透明度和问责制方面的实用价值。
引用
@article{arxiv.2605.25902,
title = {Reading the Finetuning Prior: Verbatim Content Recovery via Contrastive Decoding Diffing},
author = {Michał Brzozowski and Zuzanna Dubanowska and Enrico Cassano and Neo Christopher Chung},
journal= {arXiv preprint arXiv:2605.25902},
year = {2026}
}