中文

端到端谱-时图注意力网络用于说话人验证反欺骗与语音深度伪造检测

音频与语音处理 2021-08-24 v2 声音

摘要

用于区分真实语音与欺骗或深度伪造语音的伪影已知存在于特定子带和时间段中。可使用各种方法来捕获和建模此类伪影,然而,没有一种方法能在多种不同欺骗攻击中表现良好。可靠的检测往往依赖于多个检测系统的融合,每个系统调谐以检测不同形式的攻击。在本文中,我们展示了当融合在模型内部执行且表示从原始波形输入自动学习时,可以取得更好的性能。主要贡献是一个谱-时图注意力网络(GAT),它学习跨越不同子带和时间间隔的线索之间的关系。使用谱(S)和时(T)子图的模型级图融合以及图池化策略以改善判别性,所提出的 RawGAT-ST 模型在 ASVspoof 2019 逻辑访问数据库上实现了 1.06% 的等错误率。这是迄今报道的最佳结果之一,并且可使用开源实现复现。

关键词

引用

@article{arxiv.2107.12710,
  title  = {End-to-End Spectro-Temporal Graph Attention Networks for Speaker Verification Anti-Spoofing and Speech Deepfake Detection},
  author = {Hemlata Tak and Jee-weon Jung and Jose Patino and Madhu Kamble and Massimiliano Todisco and Nicholas Evans},
  journal= {arXiv preprint arXiv:2107.12710},
  year   = {2021}
}

备注

Accepted in ASVspoof 2021 Workshop