HarmonicAttack:一种自适应的跨域音频水印移除方法
声音
2026-05-20 v2 人工智能
摘要
高质量 AI 生成音频的可用性提升了如虚假信息活动和语音克隆欺诈等安全挑战。通过对 AI 生成音频进行水印标记,以便轻松地将其与真实音频区分开来,是防止滥用 AI 生成音频的关键防线。寻求滥用 AI 生成音频的行为者可能尝试移除音频水印,因此研究有效的水印移除技术对于客观评估音频水印的鲁性至关重要。以往的水印移除方案通常假设在移除过程中拥有目标水印检测器的访问权限,这种假设往往不切实际,可能导致对当前水印方案的错误安全信心。我们引入 HarmonicAttack,这是一种无需访问目标水印算法即可进行的音频水印移除方法。它仅需大量原始和水印样本来训练一个能够从音频样本中移除水印的通用模型。我们还发现,训练样本无需与目标样本共享相同的分布,因为我们的攻击对分布外样本具有很好的鲁性。与现有的水印移除攻击方法相比,HarmonicAttack 在移除来自 AudioSeal、WavMark、SilentCipher 和 AudioMarkNet 等最新水印方案的水印方面更有效,同时保持高保真度。尽管 HarmonicAttack 是在 LibriSpeech 数据集上针对 AudioSeal 训练的,但它能够跨越未见数据集和水印方案。例如,在 VCTK 上,HarmonicAttack 对 AudioMarkNet 的 ASR 达到 92%,显著优于最佳基线的 38%。在 FMA 上,HarmonicAttack 对所有水印实现 100% ASR,而最佳基线仅对 AudioSeal 实现 2%,对 WavMark 实现 44%。
引用
@article{arxiv.2511.21577,
title = {HarmonicAttack: An Adaptive Cross-Domain Audio Watermark Removal},
author = {Kexin Li and Xiao Hu and Ilya Grishchenko and David Lie},
journal= {arXiv preprint arXiv:2511.21577},
year = {2026}
}
备注
Under Review