中文

利用口令相关深度自编码器生成数据用于文本相关说话人确认

声音 2021-02-04 v1 机器学习 音频与语音处理

摘要

本文提出一种新方法,训练基于口令特定深度神经网络(PP-DNN)的自编码器,为文本相关说话人确认(TD-SV)生成增强数据。每个 PP-DNN 自编码器使用目标注册集中特定口令的语音进行训练,采用两种方法:(i)迁移学习和(ii)从头训练。接着,将给定语音的特征向量输入 PP-DNN,每个 PP-DNN 在帧级的输出被视为一组新生成的资料。与仅使用可用评估数据的常规方法不同,每个 PP-DNN 生成的资料被用于构建 TD-SV 系统。所提方法可视为利用各 PP-DNN 学习的非线性变换将数据变换到口令特定空间。该方法构建了若干个 TD-SV 系统,其数量等于分别为各口令训练的 PP-DNN 数量,用于评估。最后,融合不同 TD-SV 系统的分数进行决策。实验在 RedDots 2016 挑战赛数据库上使用短语音进行 TD-SV。结果表明,所提方法在使用高斯混合模型-通用背景模型(GMM-UBM)和 i-vector 框架时,对常规倒谱特征和深度瓶颈特征均提升了性能。

关键词

引用

@article{arxiv.2102.02074,
  title  = {Data Generation Using Pass-phrase-dependent Deep Auto-encoders for Text-Dependent Speaker Verification},
  author = {Achintya Kumar Sarkar and Md Sahidullah and Zheng-Hua Tan},
  journal= {arXiv preprint arXiv:2102.02074},
  year   = {2021}
}