用于重放和深度伪造音频检测的自注意力与混合特征
声音
2024-01-12 v1 多媒体
音频与语音处理
摘要
由于深度学习的成功应用,音频欺骗检测已取得显著进展。通过语音合成或语音转换生成的欺骗音频可以被许多对策很好地检测出来。然而,自动说话人验证系统仍然容易受到重放或深度伪造音频等欺骗攻击。深度伪造音频是指使用文本到语音(TTS)和语音转换(VC)算法生成的欺骗性话语。在此,我们提出了一种基于混合特征与自注意力机制的新型框架。预期混合特征可用于获得更强的区分能力。首先,不同于仅使用一种类型的传统特征,深度学习特征和梅尔频谱图特征将通过两条并行路径提取:卷积神经网络和短时傅里叶变换(STFT)后接梅尔频率。其次,特征将通过最大池化层进行拼接。第三,引入自注意力机制以聚焦于关键元素。最后,构建 ResNet 和一个线性层以获得结果。实验结果表明,与传统特征相比,混合特征能够覆盖话语的更多细节。我们在 ASVspoof 2021 数据集上,在物理访问(PA)场景中实现了 9.67% 的最佳等错误率(EER),在深度伪造任务中实现了 8.94% 的最佳等错误率。与最佳基线系统相比,所提出的方法分别提升了 74.60% 和 60.05%。
引用
@article{arxiv.2401.05614,
title = {Self-Attention and Hybrid Features for Replay and Deep-Fake Audio Detection},
author = {Lian Huang and Chi-Man Pun},
journal= {arXiv preprint arXiv:2401.05614},
year = {2024}
}