面向自回归音频生成模型的稳健无失真水印
声音
2025-10-27 v1
摘要
下一词预测模型的快速发展推动了其在多个模态上的广泛采用,使得能够创建逼真的合成媒体成为可能。在音频领域,尽管自回归语音模型推动了对话交互的发展,但用于欺骗性钓鱼或制作误导性语音录音的潜在滥用也随之增加。因此,防水印技术变得至关重要,以确保数字媒体的真实性。传统用于自回归语言模型的统计水印方法在应用于自回归音频模型时面临挑战,由于不可避免的“重标记不匹配”问题——即原始离散音频标记序列与重新标记后的序列之间的差异。为此,我们提出了Aligned-IS,这是一种专为音频生成模型设计的新型、无失真水印技术。该技术利用聚类方法将同一聚类内的标记等效处理,从而有效抵消重标记不匹配问题。我们在主流音频生成平台上的全面测试表明,Aligned-IS不仅保留了生成音频的质量,还显著提高了相对于现有无失真水印适配方法的水印可检测性,为安全音频技术应用树立了新的基准。
引用
@article{arxiv.2510.21115,
title = {Robust Distortion-Free Watermark for Autoregressive Audio Generation Models},
author = {Yihan Wu and Georgios Milis and Ruibo Chen and Heng Huang},
journal= {arXiv preprint arXiv:2510.21115},
year = {2025}
}