VIDSTAMP:一种用于视频扩散模型所有权与完整性的时间感知水印
计算机视觉与模式识别
2025-11-21 v2 密码学与安全
机器学习
摘要
视频扩散模型可以生成逼真且时间一致的视频。这引发了关于来源、所有权和完整性的担忧。水印技术可以通过将元数据直接嵌入内容来帮助解决这些问题。为了有效工作,水印需要足够的容量来承载有意义的元数据。它还必须保持不可感知性,并对常见的视频操作保持鲁棒性。现有方法在容量有限、额外推理成本或视觉质量下降方面存在困难。我们引入了 VidStamp,这是一个通过潜在视频扩散模型的解码器嵌入帧级消息的水印框架。该解码器分两个阶段进行微调。第一阶段使用静态图像数据集来促进空间消息分离。第二阶段使用合成的视频序列来恢复时间一致性。这种方法能够实现高容量水印,同时将感知影响降至最低。VidStamp 还通过一个控制信号支持动态水印,该信号在推理过程中选择消息模板。这增加了灵活性,并创建了第二个通信通道。我们在 Stable Video Diffusion (I2V)、OpenSora 和 Wan (T2V) 上评估了 VidStamp。该系统每帧嵌入 48 比特,同时保持视觉质量并对常见失真保持鲁棒性。与 VideoSeal、VideoShield 和 RivaGAN 相比,它实现了更低的 log P 值和更强的可检测性。其逐帧水印设计还实现了精确的时间篡改定位,准确率达到 0.96,超过了 VideoShield 基线。代码:https://github.com/SPIN-UMass/VidStamp
引用
@article{arxiv.2505.01406,
title = {VIDSTAMP: A Temporally-Aware Watermark for Ownership and Integrity in Video Diffusion Models},
author = {Mohammadreza Teymoorianfard and Siddarth Sitaraman and Shiqing Ma and Amir Houmansadr},
journal= {arXiv preprint arXiv:2505.01406},
year = {2025}
}