用于文本无关说话人验证与音素分析的时间动态卷积神经网络
音频与语音处理
2022-02-09 v2
摘要
在文本无关说话人识别领域,为考虑语音的音素变化特性,已有研究提出沿时间轴自适应的动态模型。然而,关于动态模型如何依音素起作用的细致分析尚不充分。本文提出时间动态 CNN(TDY-CNN),通过对每个时间帧施加最优自适应核来考虑音素的时间变化。这些核通过对训练所得基核进行加权求和来自适应于时间帧。随后,分析了自适应核在各层对不同音素的作用方式。采用六个基核的 TDY-ResNet-38(x0.5) 相比基线模型 ResNet-38(x0.5),将说话人验证性能等错误率(EER)降低了 17.3%。此外,我们表明自适应核依赖于音素组,且在早期层更具音素特异性。该时间动态模型在训练时无需显式给定音素信息即可自适应于音素,结果表明在话语内考虑音素变化对更准确、更鲁棒的文本无关说话人验证是必要的。
引用
@article{arxiv.2110.03213,
title = {Temporal Dynamic Convolutional Neural Network for Text-Independent Speaker Verification and Phonemetic Analysis},
author = {Seong-Hu Kim and Hyeonuk Nam and Yong-Hwa Park},
journal= {arXiv preprint arXiv:2110.03213},
year = {2022}
}
备注
Accepted to ICASSP 2022