中文

VLA-Mark:面向大型视觉-语言对齐模型的跨模态水印

计算机视觉与模式识别 2025-09-22 v2 人工智能

摘要

视觉-语言模型需要水印解决方案,以在不损害多模态连贯性的前提下保护知识产权。现有的文本水印方法通过有偏的令牌选择和静态策略破坏了视觉-文本对齐,使得语义关键概念易受攻击。我们提出了VLA-Mark,一个视觉对齐的框架,通过跨模态协调嵌入可检测的水印,同时保持语义保真度。我们的方法集成了多尺度视觉-文本对齐度量,结合了局部块亲和性、全局语义连贯性和上下文注意力模式,以指导水印注入,而无需模型重新训练。一个熵敏感机制动态平衡水印强度和语义保留,在低不确定性生成阶段优先考虑视觉基础。实验表明,与传统方法相比,PPL降低了7.4%,BLEU提高了26.6%,并实现了近乎完美的检测(98.8% AUC)。该框架对诸如释义和同义词替换等攻击表现出96.1%的攻击鲁棒性,同时保持了文本-视觉一致性,为保持质量的多模态水印建立了新标准。

关键词

引用

@article{arxiv.2507.14067,
  title  = {VLA-Mark: A cross modal watermark for large vision-language alignment model},
  author = {Shuliang Liu and Qi Zheng and Jesse Jiaxi Xu and Yibo Yan and Junyan Zhang and He Geng and Aiwei Liu and Peijie Jiang and Jia Liu and Yik-Cheung Tam and Xuming Hu},
  journal= {arXiv preprint arXiv:2507.14067},
  year   = {2025}
}

备注

Accepted by the main conference, EMNLP 2025