中文

用于检测合成语音的深度时频伪影

声音 2022-10-12 v1 人工智能 音频与语音处理

摘要

音频深度合成检测(ADD)挑战赛旨在检测生成的人类语音。在本文中,我们结合所提交的系统,对赛道 1(低质量伪造音频检测)和赛道 2(部分伪造音频检测)进行了全面评估。本文利用原始时域信号、频谱特征以及深度嵌入特征来检测时频伪影。针对赛道 1,我们的系统融合了低质量数据增强、通过微调实现的领域适应以及多种互补特征信息融合。此外,我们通过可视化方法分析了具有不同特征的子系统的聚类特性,并解释了所提出的贪婪融合策略的有效性。对于赛道 2,使用自监督学习结构检测帧过渡和平滑处理,以捕捉时域中部分伪造(PF)攻击的篡改痕迹。我们在赛道 1 和赛道 2 中分别排名第 4 和第 5。

关键词

引用

@article{arxiv.2210.05254,
  title  = {Deep Spectro-temporal Artifacts for Detecting Synthesized Speech},
  author = {Xiaohui Liu and Meng Liu and Lin Zhang and Linjuan Zhang and Chang Zeng and Kai Li and Nan Li and Kong Aik Lee and Longbiao Wang and Jianwu Dang},
  journal= {arXiv preprint arXiv:2210.05254},
  year   = {2022}
}

备注

7 pages, 1 figures, Accecpted by Proceedings of the 1st International Workshop on Deepfake Detection for Audio Multimedia