中文

SURT 2.0:基于转导器的多说话人语音识别的进展

音频与语音处理 2023-09-20 v2 声音

摘要

流式分离与识别转导器(SURT)模型近期被提出,作为一种用于连续、流式、多说话人语音识别(ASR)的端到端方法。尽管在多轮会议中取得了令人印象深刻的成果,SURT 仍有显著局限:(i) 它存在泄漏与遗漏相关的错误;(ii) 其计算开销大,因此未在学术界得到采用;(iii) 它仅在合成混合语音上做过评测。在本工作中,我们对原始 SURT 提出若干精心设计的修改以修复上述局限。具体而言,我们 (i) 将分离模块改为采用双路径建模的掩码估计器,(ii) 为转导器使用流式 zipformer 编码器与无状态解码器,(iii) 利用强制对齐子段进行混合仿真,(iv) 在单说话人数据上预训练转导器,(v) 采用掩码损失与编码器 CTC 损失形式的辅助目标,以及 (vi) 进行远场识别的域适应。我们表明,我们的修改使 SURT 2.0 在多说话人 ASR 结果上超越其前身,同时效率足以用学术资源训练。我们在 3 个公开会议基准——LibriCSS、AMI 与 ICSI 上进行评测,我们的最佳模型在远场未分段录音上分别取得 16.9%、44.6% 与 32.2% 的词错率(WER)。我们发布训练配方与预训练模型:https://sites.google.com/view/surt2。

关键词

引用

@article{arxiv.2306.10559,
  title  = {SURT 2.0: Advances in Transducer-based Multi-talker Speech Recognition},
  author = {Desh Raj and Daniel Povey and Sanjeev Khudanpur},
  journal= {arXiv preprint arXiv:2306.10559},
  year   = {2023}
}

备注

13 pages, 7 figures. To appear in IEEE TASLP. Project webpage: https://sites.google.com/view/surt2