中文

伪造语音检测:面向端到端参数化可学习滤波器方法

音频与语音处理 2022-06-28 v1 声音

摘要

自动说话人验证系统在生物特征识别应用中具有用于逻辑访问控制与认证的潜力。若 ASV 系统被攻破,许多事务将面临风险。初步工作分别对 (Novoselov et al., 2016) 与 (Alam et al., 2016a) 中提出的基于小波与基于 MFCC 的先进欺骗检测技术进行了比较分析。在 ASVspoof 2015 上的结果证明了我们倾向于小波特征而非 MFCC 特征的合理性。在 ASVspoof 2019 数据库上的实验表明传统手工特征缺乏可信度,并使我们更有理由转向使用端到端深度神经网络及更近期的技术。我们以 Sincnet 架构作为基线。通过将 Sinc 层替换为小波散射与连续小波变换层,我们得到了分别称为 WSTnet 与 CWTnet 的端到端深度学习模型。在 ASVspoof 2019 的现代欺骗攻击上评估时,融合模型相对于传统手工模型与我们的 Sincnet 基线分别取得了 62% 与 17% 的相对提升。CWTnet 中最终尺度分布与所用尺度数量远非当前任务的最优。为解决此问题,我们在 CWTnet 架构中以小波反卷积(WD)(Khan and Yener, 2018) 层替换 CWT 层。该层计算类似于 CWTnet 的离散-连续小波变换,同时还利用反向传播优化尺度参数。在 ASVspoof 2019 数据集上评估时,WDnet 模型相对于 CWTnet 与 Sincnet 模型分别取得了 26% 与 7% 的相对提升。这表明相较于 CWTnet 提取的特征,其所提取的特征更具泛化性,因其仅关注最重要且相关的频率区域。

关键词

引用

@article{arxiv.2206.13066,
  title  = {Detection of Doctored Speech: Towards an End-to-End Parametric Learn-able Filter Approach},
  author = {Rohit Arora},
  journal= {arXiv preprint arXiv:2206.13066},
  year   = {2022}
}

备注

arXiv admin note: text overlap with arXiv:1904.05441 by other authors