中文

modelDNA:基于采样权重指纹的校准谱系验证与合并分解

机器学习 2026-07-12 v1

摘要

开放权重语言模型的谱系图是自我报告的:Hugging Face的base_model元数据字段是可选的且未经验证,超过60%的Hub模型未记录任何父代关系。研究文献中存在从权重检测谱系的方法,但每种方法都以论文代码形式发布,绑定于单一信号和单一实验;当出现来源争议时,分析需要手工重做。本报告描述了modelDNA,一种从约100-300 MB的范围HTTP读取(而非7B模型的完整15 GB下载)中对模型进行指纹识别的工具,将指纹与跨四个已发表信号家族的参考基础模型数据库进行比较,并返回八种判定类别之一,附带校准概率,倾向于诚实的弃权而非自信的错误。在一个包含15个具有组织文档化父代关系的真实Hub模型的基准上,针对8个候选基础(13个正样本,107个硬负样本)进行评判,该系统实现了AUROC 1.0,在其报告阈值下零假阳性,以及13/13正确的top-1父代归属。本报告的第二个贡献是合并分解。每种主流权重合并方法在每张量上都是(近似)线性的,且指纹采样位置是张量身份的确定性函数,因此合并模型的指纹是其父代指纹的相同线性组合。因此,混合权重可以仅通过指纹,使用和为一约束的最小二乘法恢复。针对具有已发布mergekit配置的合并作为真实值,该方法以r = 0.999恢复了slerp合并的层插值曲线,并将dare_ties合并的混合权重恢复到与已发布值相差0.011以内,而无需下载指纹之外的任何权重。所有指纹、基准以及55个模型的推断谱系图都是公开的,并且可以离线复现。

关键词

引用

@article{arxiv.2607.10617,
  title  = {modelDNA: Calibrated Lineage Verification and Merge Decomposition from Sampled Weight Fingerprints},
  author = {Muhammad Awais Bin Adil and Saad Aamir},
  journal= {arXiv preprint arXiv:2607.10617},
  year   = {2026}
}

备注

Code: https://github.com/AwaisAdilKhokhar/modelDNA . Data: https://huggingface.co/datasets/AwaisAdilKhokhar/modeldna-atlas . Live scanner: https://huggingface.co/spaces/AwaisAdilKhokhar/modelDNA . DOI: 10.5281/zenodo.21305586