P2Mark:面向神经语音生成的参数级即插即用水印技术
声音
2025-05-06 v2
摘要
神经语音生成(Neural speech generation, NSG)作为人工智能生成内容(AI-generated content)的关键组件,正在快速发展,使其能够为多样化的应用场景生成高质量、高度逼真的语音。这种发展增加了技术滥用风险,威胁社会安全。音频水印可以通过嵌入不可感知的水印信息到生成的音频中,为安全的神经语音生成提供了有前景的解决方案。然而,现有的音频水印方法主要应用于音频级或特征级,尚不适用于源代码和模型权重被公开的开放源码场景。为克服这一限制,我们提出了面向神经语音生成的参数级即插即用水印方法(P2Mark, Plug-and-play Parameter-level WaterMarking)。具体而言,我们将水印嵌入到公开的模型权重中,为开放源码场景下的主动追踪和保护模型版权提供了可靠方案。在训练过程中,我们在预训练模型中引入轻量级水印适配器,允许水印信息通过该适配器融合到模型中。这种设计既确保了在模型发布前修改水印的灵活性,也确保了在模型发布后将水印嵌入模型参数中的安全性。同时,我们提出了梯度正交投影优化策略,以确保生成音频的质量和水印保存的准确性。在两个主流神经语音生成中枪(即声码器和编解码器)上的实验结果表明,P2Mark在水印提取准确性、水印不可感知性和鲁棒性方面,能够与适用于开放源码白盒保护场景的领先音频水印方法相当。
引用
@article{arxiv.2504.05197,
title = {P2Mark: Plug-and-play Parameter-level Watermarking for Neural Speech Generation},
author = {Yong Ren and Jiangyan Yi and Tao Wang and Jianhua Tao and Zheng Lian and Zhengqi Wen and Chenxing Li and Ruibo Fu and Ye Bai and Xiaohui Zhang},
journal= {arXiv preprint arXiv:2504.05197},
year = {2025}
}