面向自动说话人验证中重放欺骗检测的深度生成式变分自编码方法
音频与语音处理
2020-03-24 v1
摘要
自动说话人验证(ASV)系统极易受到呈现攻击(亦称欺骗攻击)的威胁。重放攻击是其中最容易实施的攻击之一,却难以可靠检测。欺骗对策(CMs)的泛化失效已促使研究者探索多种替代性的深度学习CMs。其中大多数属于有监督方法,学习人类与欺骗样本间的判别器。本文倡导一种不同的深度生成式方法,利用强大的无监督流形学习进行分类。其潜在优势包括可采样新数据,以及洞察真实与欺骗语音的潜在特征。为此,我们提出将变分自编码器(VAEs)作为重放攻击检测的替代后端,通过三种在类条件设置上不同的模型实现。第一种类似于高斯混合模型(GMMs)在欺骗检测中的用法,即为每一类独立训练两个VAE。第二种是通过向编码器与解码器网络注入独热类标签向量来训练单一条件模型(C-VAE)。我们最终的方案集成了一个辅助分类器以引导潜在空间的学习。在ASVspoof 2017与2019物理接入子任务数据集上使用常数Q倒谱系数(CQCC)特征的实验结果表明,C-VAE相较为每类训练两个独立VAE有显著改进。在2019数据集上,C-VAE在等错误率(EER)与串联检测代价函数(t-DCF)指标上均以绝对9–10%的优势超越VAE与基线GMM。最后,我们提出VAE残差——即原始输入与重构之间的绝对差——作为欺骗检测的特征。
引用
@article{arxiv.2003.09542,
title = {Deep Generative Variational Autoencoding for Replay Spoof Detection in Automatic Speaker Verification},
author = {Bhusan Chettri and Tomi Kinnunen and Emmanouil Benetos},
journal= {arXiv preprint arXiv:2003.09542},
year = {2020}
}
备注
Accepted to Computer Speech and Language Special issue on Advances in Automatic Speaker Verification Anti-spoofing, 2020