MelShield:面向 AI 生成合成语音 provenance 归因的鲁棒 Mel 域音频水印
声音
2026-05-05 v1 密码学与安全
摘要
本文提出 MelShield,一种稳健的、在生成过程中的、带密钥的音频水印框架,用于在 AI 生成音频中嵌入可识别信号,以实现版权保护和可靠归因。具体而言,MelShield 在生成过程中 operates 在 Mel 频谱图域中,针对文本到语音 (TTS) 生成中 Mel 条件管线的中间声学表示进行操作。核心思想是将中间 Mel 频谱图作为宿主信号,并通过低能量、带密钥的扩频扰动嵌入短二进制载荷,这些扰动分布在精选的时间频率区域。通过在声码器推理前进行水印嵌入,MelShield 可被集成到不需修改或重新训练底层 TTS 生成声码器(如 DiffWave 和 HiFi-GAN)的 Mel 条件 TTS 架构中。此外,多用户密钥构造实现可扩展的用户特定归因,而带密钥的验证机制限制了未授权的解码,从而降低大规模抽取探针和对抗分析的风险。在 DiffWave 和 HiFi-GAN 上进行大量实验表明,MelShield 能够实现可靠的水印提取,甚至在压缩和加性噪声等信号失真下也可接近 100% 的位准确率,同时保持高 perceptual 音频质量。
引用
@article{arxiv.2605.01515,
title = {MelShield: Robust Mel-Domain Audio Watermarking for Provenance Attribution of AI Generated Synthesized Speech},
author = {Yutong Jin and Qi Li and Lingshuang Liu and Jianbing Ni},
journal= {arXiv preprint arXiv:2605.01515},
year = {2026}
}
备注
Accepted by ACISP 2026