中文

基于说话人特征时间一致性与分布的合成语音检测

音频与语音处理 2023-10-02 v1 声音

摘要

当前的合成语音检测(SSD)方法在某些数据集上表现良好,但仍面临鲁棒性和可解释性问题。一个可能的原因是这些方法未分析合成语音的缺陷。本文分析了文本到语音(TTS)过程中固有的说话人特征缺陷。由于 TTS 缺乏对说话人特征的细粒度控制,句内说话人特征的时间一致性出现差异。由于 TTS 中的说话人表示基于编码器提取的说话人嵌入,合成语音与真实语音之间句间说话人特征的分布存在差异。基于这些分析,提出了一种基于说话人特征时间一致性与分布的合成语音检测方法。一方面,对句内说话人特征的时间一致性建模有助于语音反欺骗。另一方面,句间说话人特征的分布差异可用于 SSD。所提方法计算复杂度低,并在跨数据集和静音裁剪场景下均表现良好。

关键词

引用

@article{arxiv.2309.16954,
  title  = {Synthetic Speech Detection Based on Temporal Consistency and Distribution of Speaker Features},
  author = {Yuxiang Zhang and Zhuo Li and Jingze Lu and Wenchao Wang and Pengyuan Zhang},
  journal= {arXiv preprint arXiv:2309.16954},
  year   = {2023}
}

备注

5 pages, 3 figures, 4 tables