DKU-SMIIP 参加 NIST 2018 说话人识别评测的系统
音频与语音处理
2019-07-05 v1
摘要
本文给出 DKU 语音与多模态智能信息处理(SMIIP)实验室针对 NIST 2018 说话人识别评测的系统提交。我们探索各类最先进前端提取器与后端建模,用于文本无关说话人验证。我们提交的主系统采用多种最先进前端提取器,包括 MFCC i-vector、DNN tandem i-vector、TDNN x-vector 与深度 ResNet。在提取说话人嵌入后,我们利用若干后端建模来执行变异补偿与域适应,以应对不匹配的训练与测试条件。在固定条件下提交的最终系统在 CMN2 与 VAST 评测数据上分别取得 0.392 与 0.494 的实际检测代价。官方评测后,我们通过考察深度 ResNet 系统的多种编码层设计与损失函数进一步扩展实验。
引用
@article{arxiv.1907.02191,
title = {The DKU-SMIIP System for NIST 2018 Speaker Recognition Evaluation},
author = {Danwei Cai and Weicheng Cai and Ming Li},
journal= {arXiv preprint arXiv:1907.02191},
year = {2019}
}
备注
Accepted by Interspeech 2019