基于韵律增强的孪生卷积神经网络用于跨设备文本无关说话人验证
音频与语音处理
2018-08-06 v1 计算机视觉与模式识别
机器学习
声音
摘要
本文提出了一种新颖的跨设备文本无关说话人验证架构。当前用于说话人验证任务的大多数最先进深度架构都采用梅尔频率倒谱系数。相比之下,我们提出的孪生卷积神经网络架构使用梅尔频谱图系数,以利用相邻谱时特征的依赖性。此外,尽管谱时特征已被证明在说话人验证模型中高度可靠,但它们仅表征说话人语音短期声学层面特征的某些方面。然而,人类语音包含多个语言层面,如声学、词汇、韵律和语音,这些均可用于说话人验证模型。为弥补谱时特征中这些固有缺陷,我们提出通过部署多层感知机网络来融合韵律、抖动和微颤特征,从而增强所提出的孪生卷积神经网络架构。该端到端验证架构同时执行特征提取与验证。所提架构在法证跨设备说话人验证上相较经典信号处理方法与深度算法有显著提升。
引用
@article{arxiv.1808.01026,
title = {Prosodic-Enhanced Siamese Convolutional Neural Networks for Cross-Device Text-Independent Speaker Verification},
author = {Sobhan Soleymani and Ali Dabouei and Seyed Mehdi Iranmanesh and Hadi Kazemi and Jeremy Dawson and Nasser M. Nasrabadi},
journal= {arXiv preprint arXiv:1808.01026},
year = {2018}
}
备注
Accepted in 9th IEEE International Conference on Biometrics: Theory, Applications, and Systems (BTAS 2018)