重叠语音检测的大规模学习:新基准与通用新系统
声音
2023-09-08 v3 音频与语音处理
摘要
重叠语音检测(OSD)是涉及多方对话分析的语音应用的重要部分。然而,现有多数OSD系统在小规模数据集与有限应用域上训练评估,导致其鲁棒性缺乏评估基准,且在真实声学环境中准确率不足。为解决这些问题,我们开展了OSD任务中大规模学习(LSL)的研究,并基于Conformer网络与LSL提出名为CF-OSD的通用OSD新系统。研究中,我们制作了由151小时不同风格、语言与声源距离的标注语音组成的大规模测试集,用作评估OSD系统通用性的新基准。我们设计严谨的对比实验评估LSL在OSD任务中的有效性,并定义通用OSD系统的OSD模型。实验结果表明,LSL能显著提升OSD系统的准确率与鲁棒性,且带LSL的CF-OSD系统在我们提出的基准上显著优于其他OSD系统。此外,我们的系统在现有小规模数据集基准上也取得了最先进性能,在Alimeeting测试集与DIHARD II评估集上分别达到81.6%与53.8%。
引用
@article{arxiv.2308.05987,
title = {Large-Scale Learning on Overlapped Speech Detection: New Benchmark and New General System},
author = {Zhaohui Yin and Jingguang Tian and Xinhui Hu and Xinkang Xu and Yang Xiang},
journal= {arXiv preprint arXiv:2308.05987},
year = {2023}
}