中文

面向对抗性语音合成的协作水印方法

音频与语音处理 2024-01-03 v2 人工智能 机器学习 声音

摘要

神经语音合成的发展不仅带来了接近人类自然度的技术,还具备了以少量数据即时克隆声音的能力,并且通过可用的预训练模型高度易得。自然地,生成内容的潜在泛滥引发了对合成语音检测与水印的需求。近来,合成语音检测的大量研究工作与自动说话人验证与欺骗对策挑战(ASVspoof)相关,该挑战聚焦于被动对策。本文对生成语音检测采取一种互补视角:合成系统应主动努力对生成语音进行水印嵌入,以助于另一机器检测,同时对人耳听者保持透明。我们提出一种用于合成语音水印的协作训练方案,并表明HiFi-GAN神经声码器与ASVspoof 2021基线对策模型协作可较常规分类器训练持续提升检测性能。此外,我们展示了协作训练如何与增强策略结合以增添对抗噪声与时间拉伸的鲁棒性。最后,听感测试表明协作训练对声码器语音的感知质量几无不良影响。

关键词

引用

@article{arxiv.2309.15224,
  title  = {Collaborative Watermarking for Adversarial Speech Synthesis},
  author = {Lauri Juvela and Xin Wang},
  journal= {arXiv preprint arXiv:2309.15224},
  year   = {2024}
}

备注

Accepted to ICASSP 2024