用于语音反欺骗的复值神经网络
声音
2023-08-24 v1 机器学习
音频与语音处理
摘要
当前的反欺骗与音频深度伪造检测系统或使用基于幅度谱图的特征(如 CQT 或梅尔谱图),或使用经卷积或 sinc 层处理的原始音频。两种方法均有缺陷:幅度谱图丢弃了相位信息,影响音频自然度;而基于原始特征的模型无法使用传统的可解释 AI 方法。本文提出一种新方法,利用复值神经网络处理输入音频的复值 CQT 频域表示,从而结合两类方法的优势。该方法保留相位信息并支持可解释 AI 方法。结果表明,此方法在“In-the-Wild”反欺骗数据集上优于先前方法,并可通过可解释 AI 对结果进行解读。消融实验证实,模型已学会利用相位信息检测语音欺骗。
引用
@article{arxiv.2308.11800,
title = {Complex-valued neural networks for voice anti-spoofing},
author = {Nicolas M. Müller and Philip Sperl and Konstantin Böttinger},
journal= {arXiv preprint arXiv:2308.11800},
year = {2023}
}
备注
Interspeech 2023