中文

深度音频水印是浅层的:语音事后水印技术的局限性

声音 2025-04-16 v1 音频与语音处理

摘要

在音频模态中,最先进的水印方法利用深度神经网络在生成的音频中嵌入人类无法感知的签名。其理想状态是嵌入的签名在水印音频经过压缩、滤波或其他变换后,仍能被高精度检测到。现有的音频水印技术以事后方式运行,在音频生成后操纵其“低级”特征(例如,通过添加低幅值水印信号)。我们表明,这种事后构造使得现有的音频水印容易受到基于变换的移除攻击。聚焦于语音音频,我们(1)统一并扩展了关于音频变换对水印可检测性影响的现有评估,并(2)证明在不知道水印方案且音频质量仅有极小退化的情况下,即可移除最先进的事后音频水印。

关键词

引用

@article{arxiv.2504.10782,
  title  = {Deep Audio Watermarks are Shallow: Limitations of Post-Hoc Watermarking Techniques for Speech},
  author = {Patrick O'Reilly and Zeyu Jin and Jiaqi Su and Bryan Pardo},
  journal= {arXiv preprint arXiv:2504.10782},
  year   = {2025}
}

备注

ICLR 2025 Workshop on GenAI Watermarking