中文

基于双路径换能器的连续流式多说话人语音识别

音频与语音处理 2022-01-25 v2 声音

摘要

多说话人对话的流式识别迄今仅在 2 说话人单轮会话上评估。本文使用流式分离与识别换能器(SURT)模型,研究其在含多说话人的多轮会议上的表现,并指出将单轮模型直接推广至这一更难设定会导致性能下降。作为解决方案,我们提出最初用于时域语音分离的双路径(DP)建模策略。我们尝试了基于 LSTM 和 Transformer 的 DP 模型,显示它们在改善词错误率(WER)性能的同时带来更快收敛。我们还探索了诸如块宽随机化与课程学习等训练策略,并通过消融研究证明其重要性。最后,我们在 LibriCSS 会议数据上评估模型,其性能可与离线基于分离的方法竞争。

关键词

引用

@article{arxiv.2109.08555,
  title  = {Continuous Streaming Multi-Talker ASR with Dual-path Transducers},
  author = {Desh Raj and Liang Lu and Zhuo Chen and Yashesh Gaur and Jinyu Li},
  journal= {arXiv preprint arXiv:2109.08555},
  year   = {2022}
}

备注

Accepted for publication at IEEE ICASSP 2022