USTC-NELSLIP 系统在 DIHARD-III 挑战赛中的系统描述
声音
2021-03-22 v1 机器学习
音频与语音处理
摘要
本系统描述介绍了我们提交至第三届 DIHARD 语音日记化挑战赛的系统。除传统的基于聚类的系统外,我们系统的创新之处在于组合了多种前端技术来解决日记化问题,包括语音分离和基于目标说话人的语音活动检测(TS-VAD),并结合迭代数据净化。我们还采用了音频域分类以设计依赖于域的处理。最后,我们进行了后处理以实现系统融合与选择。我们的系统在评估集上于 track 1 和 track 2 分别取得了 11.30% 和 16.78% 的 DER。
引用
@article{arxiv.2103.10661,
title = {USTC-NELSLIP System Description for DIHARD-III Challenge},
author = {Yuxuan Wang and Maokui He and Shutong Niu and Lei Sun and Tian Gao and Xin Fang and Jia Pan and Jun Du and Chin-Hui Lee},
journal= {arXiv preprint arXiv:2103.10661},
year = {2021}
}