中文

使用卷积循环神经网络的三分类重叠语音检测

音频与语音处理 2021-04-08 v1 机器学习 声音

摘要

本文提出一种作为三分类器训练的重叠语音检测系统。与常规系统对帧是否含重叠语音进行二分类不同,所提方法将帧分为三类:非语音、单说话人语音和重叠语音。通过以更细致的标签定义训练网络,模型可学习更好地判断给定帧中说话人数量的概念。我们探索了一种卷积循环神经网络架构,以同时利用卷积层建模局部模式的能力与循环层建模序列信息的能力。所提重叠语音检测模型在DIHARD II评估集上以0.6648的精确率与0.3222的召回率确立了最先进性能,召回率提升20%且精确率更高。此外,我们还引入一种简单方法,将所提重叠语音检测模型用于说话人日志,在DIHARD III挑战赛Track 1中排名第三。

关键词

引用

@article{arxiv.2104.02878,
  title  = {Three-class Overlapped Speech Detection using a Convolutional Recurrent Neural Network},
  author = {Jee-weon Jung and Hee-Soo Heo and Youngki Kwon and Joon Son Chung and Bong-Jin Lee},
  journal= {arXiv preprint arXiv:2104.02878},
  year   = {2021}
}

备注

5 pages, 2 figures, 4 tables, submitted to Interspeech as a conference paper