中文

多位音频水印

声音 2025-10-03 v1 机器学习 音频与语音处理

摘要

我们提出了 Timbru,一款后置音频水印模型,在不训练 embedder-detector 模型的情况下实现了领先的鲁棒性和不可探测性之间的trade-off。给定任意 44.1 kHz 立体声音乐片段,我们的方法对音频进行梯度优化,以在预训练音频 VAE 的潜空间中添加不可探测的扰动,由 combined message and perceptual loss(组合信息与感知损失)引导。水印随后可使用预训练 CLAP 模型进行提取。我们在 MUSDB18-HQ 上评估了 16 位水印,对抗 AudioSeal、WavMark 和 SilentCipher 等常见的滤波、噪声、压缩、重采样、裁切和再生攻击。我们的做法在保持感知质量的同时,实现了最佳的平均位错误率,展示了一种高效、无数据集依赖的不可探测音频水印之路。

关键词

引用

@article{arxiv.2510.01968,
  title  = {Multi-bit Audio Watermarking},
  author = {Luca A. Lanzendörfer and Kyle Fearne and Florian Grötschla and Roger Wattenhofer},
  journal= {arXiv preprint arXiv:2510.01968},
  year   = {2025}
}