中文

基于特征分解学习与合成器特征增强的鲁棒 AI 合成语音检测

声音 2024-11-15 v1 密码学与安全 音频与语音处理

摘要

AI 合成语音(即深度伪造语音)因语音合成与语音转换技术的快速发展,近来引发广泛关注。以往工作常依赖区分合成器伪影来识别深度伪造语音。然而,过度依赖这些特定合成器伪影,在面对未见合成器生成的语音信号时可能导致性能不佳。本文提出一种鲁棒的深度伪造语音检测方法,采用特征分解学习合成器无关的内容特征作为检测的补充。具体而言,我们提出双流特征分解学习策略,利用合成器流和内容流分解学习到的语音表示。合成器流通过带合成器标签的监督训练专门学习合成器特征。同时,内容流专注于学习合成器无关的内容特征,通过基于伪标签的监督学习方法实现:随机变换语音以生成语速和压缩标签用于训练。此外,我们采用对抗学习技术减少内容流中的合成器相关成分。最终分类由拼接的合成器特征和内容特征决定。为增强模型对不同合成器特征的鲁棒性,我们进一步提出合成器特征增强策略:在真实与伪造音频特征内随机混合特征风格,并随机打乱合成器特征与内容特征。该策略有效增强特征多样性并模拟更多特征组合。

关键词

引用

@article{arxiv.2411.09167,
  title  = {Robust AI-Synthesized Speech Detection Using Feature Decomposition Learning and Synthesizer Feature Augmentation},
  author = {Kuiyuan Zhang and Zhongyun Hua and Yushu Zhang and Yifang Guo and Tao Xiang},
  journal= {arXiv preprint arXiv:2411.09167},
  year   = {2024}
}