使用 Patched Spectrogram Transformer 实现抗压缩的合成语音检测
声音
2024-02-23 v1 计算机视觉与模式识别
机器学习
音频与语音处理
信号处理
摘要
许多深度学习合成语音生成工具现已 readily available(易于获取)。合成语音的使用导致了金融欺诈、冒充他人以及虚假信息的传播。因此,人们提出了能够检测合成语音的 forensic methods(取证方法)。现有方法往往在一个数据集上过拟合,其性能在实际场景(如检测社交平台上分享的合成语音)中大幅下降。在本文中,我们提出了 Patched Spectrogram Synthetic Speech Detection Transformer (PS3DT),这是一种合成语音检测器,它将时域语音信号转换为 mel-spectrogram(梅尔频谱图),并使用 transformer neural network(Transformer 神经网络)以 patch(块)的形式进行处理。我们在 ASVspoof2019 数据集上评估了 PS3DT 的检测性能。我们的实验表明,与其他使用 spectrogram(频谱图)进行合成语音检测的方法相比,PS3DT 在 ASVspoof2019 数据集上表现良好。我们还调查了 PS3DT 在 In-the-Wild 数据集上的泛化性能。在检测 out-of-distribution dataset(分布外数据集)中的合成语音方面,PS3DT 的泛化能力优于几种现有方法。我们还评估了 PS3DT 检测电话质量合成语音和在社交平台上分享的合成语音(压缩语音)的鲁棒性。PS3DT 具有抗压缩性,并且在检测电话质量合成语音方面优于几种现有方法。
引用
@article{arxiv.2402.14205,
title = {Compression Robust Synthetic Speech Detection Using Patched Spectrogram Transformer},
author = {Amit Kumar Singh Yadav and Ziyue Xiang and Kratika Bhagtani and Paolo Bestagini and Stefano Tubaro and Edward J. Delp},
journal= {arXiv preprint arXiv:2402.14205},
year = {2024}
}
备注
Accepted as long oral paper at ICMLA 2023