SIF:面向大型视觉语言模型的语义分布指纹
计算机视觉与模式识别
2026-04-21 v1
摘要
大型视觉语言模型 (LVLMs) 的公开可访问性引发严重的未经授权的模型复用和知识产权侵权顾虑。现有所有权验证方法常依赖语义异常查询或分布外响应作为指纹,但对手方易于检测并删除。我们通过语义偏移攻击 (SDA) 暴露了此漏洞,该方法通过衡量可疑模型与参考模型之间的语义偏移来识别并过滤指纹查询,表明现有指纹不具语义保存性,因而易被检测和绕过。为克服此限制,我们提出 SIF (Semantically In-Distribution Fingerprints),一个无需参数修改的非侵入性所有权验证框架。SIF 引入语义对齐指纹蒸馏 (SAFD),将文本水印信号转移至视觉模态,以产生语义连贯且带指纹的响应。此外,鲁棒指纹优化 (RFO) 通过模拟最坏情况表示扰动来增强鲁棒性,使指纹对微调和量化等模型修改具有韧性。在 LLaVA-1.5 和 Qwen2.5-VL 上进行大规模实验表明,SIF 在隐身性和鲁棒性方面均表现出色,为 LVLM 版权保护提供了实用方案。代码已公开于 https://github.com/UCF-ML-Research/SIF-VLM-Fingerprint。
引用
@article{arxiv.2604.17041,
title = {SIF: Semantically In-Distribution Fingerprints for Large Vision-Language Models},
author = {Yifei Zhao and Qian Lou and Mengxin Zheng},
journal= {arXiv preprint arXiv:2604.17041},
year = {2026}
}
备注
Accepted at CVPR 2026