中文

基于 SE-Res2Net-Conformer 架构的合成语音检测与音频拼接检测

音频与语音处理 2022-11-30 v2 计算与语言 密码学与安全

摘要

合成语音与拼接音频片段已被用于欺骗互联网用户以及语音认证等人工智能(AI)技术。现有研究将欺骗对策视为二分类问题:真实(bonafide) versus 伪造(spoof)。本文通过引入近期的 Conformer 模块扩展现有的 Res2Net,以进一步挖掘声学特征上的局部模式。在 ASVspoof 2019 数据库上的实验结果表明,所提出的 SE-Res2Net-Conformer 架构能够提升逻辑访问场景下欺骗对策的性能。此外,本文还提出重新定义现有的音频拼接检测问题:相较于识别完整的拼接片段,检测拼接片段的边界更具实用价值。并且,可采用深度学习方法解决该问题,这与以往的信号处理技术不同。

关键词

引用

@article{arxiv.2210.03581,
  title  = {Synthetic Voice Detection and Audio Splicing Detection using SE-Res2Net-Conformer Architecture},
  author = {Lei Wang and Benedict Yeoh and Jun Wah Ng},
  journal= {arXiv preprint arXiv:2210.03581},
  year   = {2022}
}

备注

Accepted by the 13th International Symposium on Chinese Spoken Language Processing (ISCSLP 2022)