帧到话语收敛:一种用于统一欺骗检测的光谱-时间方法
声音
2023-09-19 v1 计算机与社会
音频与语音处理
摘要
语音欺骗攻击对自动说话人验证系统构成重大威胁。现有的反欺骗方法常模拟特定攻击类型,如合成或重放攻击。然而,在真实场景中,对策并不知晓攻击的生成模式,因而需要统一解决方案。当前的统一解决方案难以检测欺骗伪影,尤其是面对近期欺骗机制。例如,欺骗算法注入光谱或时间异常,难以识别。为此,我们提出一种利用帧级和话语级系数的光谱-时间融合。我们引入一种用于帧级不一致性的新颖局部光谱偏差系数(SDC),并采用基于 bi-LSTM 的网络提取序列时间系数(STC),以捕获话语级伪影。我们的光谱-时间融合策略组合这些系数,并由自编码器生成光谱-时间偏差系数(STDC)以增强鲁棒性。我们提出的方法涵盖多种欺骗类别,包括合成、重放和局部深度伪造攻击。在多个数据集(ASVspoof2019、ASVspoof2021、VSDC、局部欺骗及野外深度伪造)上的广泛评估证明了其对广泛语音应用的鲁棒性。
引用
@article{arxiv.2309.09837,
title = {Frame-to-Utterance Convergence: A Spectra-Temporal Approach for Unified Spoofing Detection},
author = {Awais Khan and Khalid Mahmood Malik and Shah Nawaz},
journal= {arXiv preprint arXiv:2309.09837},
year = {2023}
}