中文

Safe-Sora:基于图形水印的安全文本到视频生成

计算机视觉与模式识别 2025-09-23 v2

摘要

生成式视频模型的快速增长放大了对AI生成内容可靠版权保护的需求。尽管在图像合成中水印技术备受欢迎,但在视频生成领域,隐式生成水印仍鲜有探索。为填补这一空白,我们提出Safe-Sora,将图形水印直接嵌入视频生成过程中的第一个框架。我们观察到水印性能与水印与内容视觉相似性密切相关,因而引入层次化的粗到细自适应匹配机制。具体而言,将水印图像划分为多个补丁,每个补丁分配至最视觉相似的视频帧,并进一步局部化于视频帧中最佳的空间区域,以实现无缝嵌入。为实现水印补丁在视频帧之间的时空融合,我们发展了基于3D小波变换增强的Mamba架构,并提出了新颖的时空局部扫描策略,有效地在水印嵌入和检索期间建模长程依赖。迄今为止,这是首次将时态模型应用于水印技术,为高效且稳健的水印保护开辟了新方向。大量实验表明,Safe-Sora在视频质量、水印保真度和鲁棒性方面实现了最佳性能,这在很大程度上归功于我们的创新。代码已公开于https://github.com/Sugewud/Safe-Sora

关键词

引用

@article{arxiv.2505.12667,
  title  = {Safe-Sora: Safe Text-to-Video Generation via Graphical Watermarking},
  author = {Zihan Su and Xuerui Qiu and Hongbin Xu and Tangyu Jiang and Junhao Zhuang and Chun Yuan and Ming Li and Shengfeng He and Fei Richard Yu},
  journal= {arXiv preprint arXiv:2505.12667},
  year   = {2025}
}

备注

Safa-Sora is accepted by NeurIPS 2025