中文

通过词法偏置的自回归图像水印:一种抗再生攻击的方法

密码学与安全 2025-06-03 v1

摘要

自回归(AR)图像生成模型因其合成质量上的突破而受到越来越多的关注,这凸显了需要鲁棒的水印技术来防止滥用。然而,现有的生成中水印技术主要针对扩散模型设计,水印嵌入在扩散潜空间状态中。这种设计给直接适配到通过 token 预测顺序生成图像的 AR 模型带来了重大挑战。此外,基于扩散的再生攻击可以通过扰动扩散潜空间状态来有效擦除此类水印。为了应对这些挑战,我们提出了词法偏置水印(LBW),这是一种专为 AR 模型设计并能抵抗再生攻击的新框架。LBW 通过在生成过程中将 token 选择偏向预定义的绿名单,直接将水印嵌入 token 映射中。这种方法确保了与现有 AR 模型的无缝集成,并自然地扩展到事后水印。为了提高对白盒攻击的安全性,不使用单一的绿名单,而是从绿名单池中为每张图像随机采样绿名单。水印检测通过对 token 分布的量化和统计分析来执行。大量实验表明,LBW 实现了卓越的水印鲁棒性,特别是在抵抗再生攻击方面。

关键词

引用

@article{arxiv.2506.01011,
  title  = {Autoregressive Images Watermarking through Lexical Biasing: An Approach Resistant to Regeneration Attack},
  author = {Siqi Hui and Yiren Song and Sanping Zhou and Ye Deng and Wenli Huang and Jinjun Wang},
  journal= {arXiv preprint arXiv:2506.01011},
  year   = {2025}
}