MEraser:面向大语言模型的有效指纹擦除方法
密码学与安全
2025-08-28 v2 人工智能
摘要
大语言模型(LLMs)已在各行业日益普及,引发了关于模型所有权和知识产权保护的关键关切。尽管基于后门的指纹技术已成为模型认证的有前景方案,但有效去除这些指纹的攻击方法很大程度上仍未被探索。因此,我们提出不匹配擦除器(MEraser),一种新颖的方法,能够在保持模型性能的同时有效去除大语言模型中基于后门的指纹。我们的方法利用精心构建的不匹配数据集和干净数据集,采用两阶段微调策略。通过在多种大语言模型架构和指纹方法上的广泛评估,我们证明 MEraser 能够在使用少于 1,000 个样本的最少训练数据下实现完全指纹去除,同时保持模型性能。此外,我们引入了一种可迁移擦除机制,能够在不同模型之间有效去除指纹而无需重复训练。总之,我们的方法为大语言模型中的指纹去除提供了实用解决方案,揭示了当前指纹技术的关键漏洞,并为未来开发更具韧性的模型保护方法建立了全面的评估基准。
引用
@article{arxiv.2506.12551,
title = {MEraser: An Effective Fingerprint Erasure Approach for Large Language Models},
author = {Jingxuan Zhang and Zhenhua Xu and Rui Hu and Wenpeng Xing and Xuhong Zhang and Meng Han},
journal= {arXiv preprint arXiv:2506.12551},
year = {2025}
}
备注
Accepted by ACL 2025, Main Conference, Long Paper