用于欺骗检测的 DNN 滤波器组倒谱系数
声音
2017-02-14 v1 密码学与安全
机器学习
摘要
随着语音合成技术的发展,自动说话人验证系统面临欺骗攻击的严重挑战。为提高说话人验证系统的可靠性,我们开发了一种新的基于滤波器组的倒谱特征,深度神经网络滤波器组倒谱系数(DNN-FBCC),以区分自然语音与欺骗语音。深度神经网络滤波器组通过使用自然与合成语音训练滤波器组神经网络(FBNN)自动生成。通过在训练规则上添加限制,FBNN 的学习权重矩阵是带限的并按频率排序,类似于常规滤波器组。与手动设计的滤波器组不同,学到的滤波器组在不同通道中具有不同的滤波器形状,能更有效地捕获自然与合成语音之间的差异。在 ASVspoof 2015 数据库上的实验结果表明,由新特征训练的高斯混合模型最大似然(GMM-ML)分类器优于基于最先进的线性频率倒谱系数(LFCC)的分类器,尤其在检测未知攻击方面。
引用
@article{arxiv.1702.03791,
title = {DNN Filter Bank Cepstral Coefficients for Spoofing Detection},
author = {Hong Yu and Zheng-Hua Tan and Zhanyu Ma and Jun Guo},
journal= {arXiv preprint arXiv:1702.03791},
year = {2017}
}