ShadowGenes:利用计算图中重复模式实现模型谱系识别
机器学习
2025-01-22 v1 密码学与安全
摘要
机器学习模型谱系识别使实践者能够确定给定神经网络属于哪个 architectural family。本文引入了 ShadowGenes,一种新型基于签名的方法用于识别给定模型的 architecture、type and family。我们的方法涉及构建与模型序列化 format 无关的 computational graph,然后分析其 internal operations 以识别 unique patterns,最后根据这些模式构建和 refinement signatures。我们阐述了底层 engine 的重要工作原理,并演示了构建 signature 和扫描给定模型的技术。这种 model genealogy 方法可应用于没有额外 external information 的 model files。我们在标注数据集上测试了 ShadowGenes,数据集包含超过 1,400 个模型,实现了 mean true positive rate of 97.49% and precision score of 99.51%;这验证了该技术作为 practical method for model genealogy。这使得实践者能够理解给定模型的 use cases、内部 computational process,以及识别可能的 security risks,如 model backdooring 的潜在风险。
引用
@article{arxiv.2501.11830,
title = {ShadowGenes: Leveraging Recurring Patterns within Computational Graphs for Model Genealogy},
author = {Kasimir Schulz and Kieran Evans},
journal= {arXiv preprint arXiv:2501.11830},
year = {2025}
}