中文

水印对文档理解视觉语言模型的影响

计算机视觉与模式识别 2025-07-17 v2 密码学与安全 机器学习

摘要

视觉语言模型(VLMs)已成为文档理解任务的基础模型,广泛应用于金融、法律和学术等领域的复杂多模态文档处理。然而,文档常包含类似噪声的信息,如水印,这不可避免地引发我们疑问:水印是否会降低VLMs在文档理解中的性能?为此,我们提出一种新型评估框架来调查可见水印对VLMs性能的影响。我们考虑 various factors,包括不同类型文档数据、水印在文档中的位置以及水印内容的变化。我们的实验结果表明,水印可显著损害VLMs性能,性能下降率可达36%。我们发现,散布式水印比集中式水印造成更强的干扰,语义内容的水印比简单视觉遮挡造成更大的 disruption。通过注意力机制分析和嵌入相似性检查,我们发现性能下降主要归因于水印1)导致广泛注意力重新分配,以及2)改变嵌入空间中的语义表示。我们的研究不仅揭示了在文档理解中部署VLMs的重要挑战,也为在水印文档上开发稳健推断机制提供了见解。

关键词

引用

@article{arxiv.2504.01048,
  title  = {How does Watermarking Affect Visual Language Models in Document Understanding?},
  author = {Chunxue Xu and Yiwei Wang and Bryan Hooi and Yujun Cai and Songze Li},
  journal= {arXiv preprint arXiv:2504.01048},
  year   = {2025}
}

备注

Accepted to COLM 2025