易解释、有效:openSMILE 用于语音深度伪造检测
音频与语音处理
2024-08-30 v2 人工智能
声音
摘要
本文展示了,针对语音真实性和深度伪造检测领域事实上的标准数据集ASVspoof5的最新攻击,仅使用极少数量的非常简单特征即可实现惊人的检测准确率。这些特征源自openSMILE库,为标量值、易于计算且具有人类可解释性。例如,攻击A10的无声段平均长度为0.09 +- 0.02,而真实例子平均长度为0.18 +- 0.07。仅使用该特征,阈值分类器即可实现A10攻击的平等错误率(EER)为10.3%。在所有攻击上,我们实现了最高达0.8%的EER,总体EER为15.7 +- 6.0%。我们探讨了这些特征的泛化能力,发现其中一些特征在不同攻击之间能够有效迁移,主要当这些攻击来自类似的文本转语音(TTS)架构时。这一发现可能表明语音防欺诈在某种程度上是识别和记忆单个TTS系统的签名或指纹的问题。这有助于更好地理解防欺诈模型及其在实际应用中的挑战。
引用
@article{arxiv.2408.15775,
title = {Easy, Interpretable, Effective: openSMILE for voice deepfake detection},
author = {Octavian Pascu and Dan Oneata and Horia Cucu and Nicolas M. Müller},
journal= {arXiv preprint arXiv:2408.15775},
year = {2024}
}