语言模型的独立性检验
机器学习
2025-03-13 v2 计算与语言
摘要
我们考虑以下问题:给定两个模型的权重,我们能否测试它们是否是独立训练的——即从独立的随机初始化训练?我们考虑两种设置:受限和不受限。在受限设置中,我们对模型架构和训练做出假设,并提出一族统计检验,产生关于模型是否是从独立随机初始化训练的原假设的精确 p 值。这些 p 值在模型训练数据的组成无关紧要时仍然有效;我们通过模拟每个模型在假设下的可交换副本,并比较原始两个模型与这些副本之间各种相似性度量来计算它们。在我们对 21 个开源模型(共 210 对)进行 p 值测试时,正确地识别了所有非独立模型的配对。即使一个模型经过许多 token 的微调,我们的检验仍然有效。在不受限设置中,我们对训练程序不做假设,允许模型架构变化,并允许对抗性规避攻击,先前的检验不再有效。相反,我们提出了一种匹配两个模型隐藏激活的新检验方法,该方法对对抗性转换和模型架构变化具有鲁棒性。该测试也可以进行局部测试:识别模型的特定非独立组件。尽管我们不再获得来自该方法的精确 p 值,但实际上我们发现它行为如预期,可靠地识别非独立模型。值得注意的是,我们可以使用该检验识别一个模型的特定部分是从另一个模型派生的(例如,Llama 3.1-8B 被修剪以初始化 Llama 3.2-3B,或 Mistral-7B 与 StripedHyena-7B 之间共享的层),且即使对其中一个模型的各个层从头重新训练,该方法也具有鲁棒性。
引用
@article{arxiv.2502.12292,
title = {Independence Tests for Language Models},
author = {Sally Zhu and Ahmed Ahmed and Rohith Kuditipudi and Percy Liang},
journal= {arXiv preprint arXiv:2502.12292},
year = {2025}
}