DIHARD II 依然困难:来自 DKU-LENOVO 团队的实验结果及讨论
音频与语音处理
2020-05-06 v2 机器学习
声音
机器学习
摘要
本文介绍了 DKULENOVO 团队提交的第二届 DIHARD 语音日记化(说话人日志)挑战赛的系统。我们的日记化系统包含多个模块,即语音活动检测(VAD)、分割、说话人嵌入提取、相似度打分、聚类、再分割和重叠检测。对于每个模块,我们探索了不同技术以提升性能。我们的最终提交采用了基于 ResNet-LSTM 的 VAD、基于 Deep ResNet 的说话人嵌入、基于 LSTM 的相似度打分以及谱聚类。变分贝叶斯(VB)日记化应用于再分割阶段,重叠检测也带来了轻微改进。我们提出的系统在 Track1 取得 18.84% 的 DER,在 Track2 取得 27.90% 的 DER。尽管我们的系统相对官方基线将 DER 分别降低了 27.5% 和 31.7%,我们认为日记化任务仍然非常困难。
引用
@article{arxiv.2002.12761,
title = {DIHARD II is Still Hard: Experimental Results and Discussions from the DKU-LENOVO Team},
author = {Qingjian Lin and Weicheng Cai and Lin Yang and Junjie Wang and Jun Zhang and Ming Li},
journal= {arXiv preprint arXiv:2002.12761},
year = {2020}
}
备注
Submitted to Odyssesy 2020