流式端到端多说话人语音识别的端点检测
音频与语音处理
2022-01-26 v1 声音
摘要
流式端到端多说话人语音识别旨在以流式方式,利用全神经模型转录对话或会议中的重叠语音,这与通常级联独立训练的语音分离和语音识别模型的模块化方法有根本区别。此前,我们针对此问题提出了基于循环神经网络转换器(RNN-T)的流式解混与识别转换器(SURT)模型,并展示了有前景的结果。然而,在实际应用中,语音识别系统还需要确定说话人结束说话的时戳,以便系统及时响应。这个问题被称为端点(EP)检测,此前尚未针对多说话人端到端模型进行过研究。在这项工作中,我们遵循单说话人端到端模型的实践,通过引入句尾符元作为输出单元,来解决SURT框架中的端点检测问题。此外,我们还提出了一种延迟惩罚方法,可以显著降低端点检测延迟。我们基于双说话人LibrispeechMix数据集的实验结果表明,SURT模型能够在不显著降低识别准确率的情况下,实现有前景的端点检测。
引用
@article{arxiv.2201.09979,
title = {Endpoint Detection for Streaming End-to-End Multi-talker ASR},
author = {Liang Lu and Jinyu Li and Yifan Gong},
journal= {arXiv preprint arXiv:2201.09979},
year = {2022}
}
备注
5 pages, accepted to ICASSP 2022