中文

通过语音波形中的指纹区分神经语音合成模型

声音 2024-06-18 v2 音频与语音处理

摘要

神经语音合成技术近期的进展在广泛应用的同时,也带来了一系列挑战,激发了对防范滥用与误用威胁的防御研究的兴趣。值得注意的是,合成语音的源头归因在取证与知识产权保护中具有价值,但该领域的先前工作在某些范围上存在局限。为弥补这些不足,我们在本文中呈现关于识别合成语音来源的发现。我们探究所生成语音波形中是否存在语音合成模型指纹,重点关注声学模型与声码器,并研究各组件对整体语音波形中指纹的影响。我们使用多说话人 LibriTTS 数据集开展研究,得出两个关键见解:(1)声码器与声学模型在其生成的波形上留下了独特的、模型特定的指纹;(2)声码器指纹是两者中更占主导的,并可能掩盖来自声学模型的指纹。这些发现有力地表明声学模型与声码器均存在模型特定的指纹,凸显了它们在源头识别应用中的潜在效用。

关键词

引用

@article{arxiv.2309.06780,
  title  = {Distinguishing Neural Speech Synthesis Models Through Fingerprints in Speech Waveforms},
  author = {Chu Yuan Zhang and Jiangyan Yi and Jianhua Tao and Chenglong Wang and Xinrui Yan},
  journal= {arXiv preprint arXiv:2309.06780},
  year   = {2024}
}

备注

Accepted by CCL 2024