通过参数学习对抗图像跟踪大型视觉语言模型的版权
人工智能
2025-02-25 v1 机器学习
摘要
大型视觉语言模型(LVLMs)在图像理解和对话能力方面展现出惊人的性能,能够处理各种视觉问答任务。然而,其广泛可用性引发了未经授权使用的担忧,用户或个人可通过微调已发布的模型开发自己的 LVLMs。本文提出一种名为参数学习攻击(PLA)的新方法,用于在不修改原始模型的情况下跟踪 LVLMs 的版权。具体而言,我们通过针对原始模型进行有针对性的攻击构建对抗图像,使其生成特定输出。为确保这些攻击在潜在微调模型上仍然有效以触发版权跟踪,我们允许原始模型在对抗攻击过程中以相反方向更新参数以学习触发图像。值得注意的是,所提方法可在模型发布后应用,因此不影响模型的性能和行为。为模拟实际应用场景,我们使用各种策略在多样数据集上微调原始模型,构建一系列模型用于版权验证。大量实验表明,我们的方法相较于基线方法能更有效地识别微调模型的原始版权。该工作为 LVLMs 的版权跟踪和检测未授权使用提供了强大工具。
引用
@article{arxiv.2502.16593,
title = {Tracking the Copyright of Large Vision-Language Models through Parameter Learning Adversarial Images},
author = {Yubo Wang and Jianting Tang and Chaohu Liu and Linli Xu},
journal= {arXiv preprint arXiv:2502.16593},
year = {2025}
}
备注
Accepted to ICLR 2025