基于靶向指纹的FIT-Print:面向抗虚假主张模型所有权验证
密码学与安全
2025-08-12 v4 人工智能
机器学习
摘要
模型指纹化是保护开源模型版权、防止未授权重用的广泛采用方法,因其无需修改受保护模型而既方便又有前景。本文重新审视现有指纹方法,揭示其对抗虚假主张攻击的脆弱性,即对手方可虚假声称拥有任何第三方模型的所有权。我们演示,这一脆弱性主要源于其非靶向性质,即它们通常比较不同模型上给定样本的输出,而非与特定参考的相似性。针对上述发现,我们提出一种靶向指纹范式(即FIT-Print),以抵御虚假主张攻击。具体而言,FIT-Print通过优化将指纹转化为靶向签名。基于FIT-Print的原理,我们发展出两种黑盒模型指纹方法,即FIT-ModelDiff和FIT-LIME,分别利用模型输出与特定样本特征归因之间的距离作为指纹。广泛的实验在基准模型和数据集上验证了FIT-Print方法的有效性、可复制性以及抗虚假主张攻击能力。
引用
@article{arxiv.2501.15509,
title = {FIT-Print: Towards False-claim-resistant Model Ownership Verification via Targeted Fingerprint},
author = {Shuo Shao and Haozhe Zhu and Yiming Li and Hongwei Yao and Tianwei Zhang and Zhan Qin},
journal= {arXiv preprint arXiv:2501.15509},
year = {2025}
}