鲁棒型LLM指纹是否对抗鲁棒?
密码学与安全
2025-10-01 v1 人工智能
机器学习
摘要
模型指纹已作为声称模型所有权的有前景范例之一。然而,这些方案的鲁棒性评估主要聚焦于良性扰动,如增量微调、模型合并和提示词。缺乏对抗鲁棒性的系统性调查使现有系统暴露于恶意模型托管者之下。为填补这一空白,我们首先定义了针对模型指纹的具体实用威胁模型。随后,我们审视了现有模型指纹方案以识别其根本性脆弱性。基于这些脆弱性,我们开发针对每种脆弱性量身定制的自适应对抗攻击,并演示这些攻击可在保持高模型效用的同时完全绕过十个最近提出的指纹方案的身份验证。我们的工作鼓励指纹设计者采用以设计为中心的抗鲁棒性。我们最后提出了针对未来指纹方法的建议。
引用
@article{arxiv.2509.26598,
title = {Are Robust LLM Fingerprints Adversarially Robust?},
author = {Anshul Nasery and Edoardo Contente and Alkin Kaz and Pramod Viswanath and Sewoong Oh},
journal= {arXiv preprint arXiv:2509.26598},
year = {2025}
}