AASIST:基于谱-时域集成图注意力网络的音频反欺骗
音频与语音处理
2021-10-05 v1 人工智能
机器学习
摘要
区分伪造与真实语音的伪影可存在于频谱或时域中。其可靠检测通常依赖于计算代价高昂的集成系统,其中每个子系统针对某些特定伪影调优。我们力求开发一种高效单一系统,无需分数级集成即可检测广泛的不同欺骗攻击。我们提出一种新颖的异质堆叠图注意力层,其通过异质注意力机制与堆叠节点对跨越异质时域与频谱域的伪影建模。借助一种包含竞争机制的新最大图操作与扩展读出方案,我们的方法 AASIST 相对当前最优 (SOTA) 提升 20%。即便是仅有 85K 参数的轻量变体 AASIST-L,也优于所有竞争系统。
引用
@article{arxiv.2110.01200,
title = {AASIST: Audio Anti-Spoofing using Integrated Spectro-Temporal Graph Attention Networks},
author = {Jee-weon Jung and Hee-Soo Heo and Hemlata Tak and Hye-jin Shim and Joon Son Chung and Bong-Jin Lee and Ha-Jin Yu and Nicholas Evans},
journal= {arXiv preprint arXiv:2110.01200},
year = {2021}
}
备注
5 pages, 1 figure, 3 tables, submitted to ICASSP2022