DSVAE:用于合成语音检测的可解释解耦表示
声音
2023-08-01 v2 计算机视觉与模式识别
多媒体
音频与语音处理
摘要
生成与人类录制语音在感知上无法区分的高质量合成语音信号的工具已很容易获取。已有多种方法被提出用于检测合成语音。其中许多方法将深度学习方法作为黑盒使用,未对其做出的决策提供解释。这限制了这些方法的可解释性。在本文中,我们提出了解耦频谱图变分自编码器,这是一种两阶段训练的变分自编码器,它使用解耦表示学习处理语音频谱图,以生成用于检测合成语音的语音信号可解释表示。DSVAE 还创建激活图,以突出区分合成语音与真实人类语音信号的频谱图区域。我们使用 ASVspoof2019 数据集评估了从 DSVAE 获得的表示。我们的实验结果显示,在检测来自 6 个已知和 10 个(共 11 个)未知语音合成器的合成语音方面具有高准确率(>98%)。我们还可视化了对 17 个不同语音合成器从 DSVAE 获得的表示,并验证了它们确实是可解释的,且能够区分每个合成器的真实与合成语音。
引用
@article{arxiv.2304.03323,
title = {DSVAE: Interpretable Disentangled Representation for Synthetic Speech Detection},
author = {Amit Kumar Singh Yadav and Kratika Bhagtani and Ziyue Xiang and Paolo Bestagini and Stefano Tubaro and Edward J. Delp},
journal= {arXiv preprint arXiv:2304.03323},
year = {2023}
}