中文

提升端到端多说话者语音识别的实用性:针对在线与离线场景

音频与语音处理 2025-06-18 v1 计算与语言 声音

摘要

我们将序列化输出训练(SOT)框架扩展到解决流式和离线自动语音识别(ASR)应用的实际需求。我们的 метод聚焦于在延迟和准确率之间进行权衡,满足实时字幕和摘要的要求。我们提出了几个关键改进:(1) 利用连续语音分离(CSS)单通道前端搭配端到端(E2E)系统,以处理高度重叠的情况,这挑战了传统的 E2E 与级联方案之间的常识。CSS 框架通过分离多个说话者的重叠语音来提高 ASR 系统的准确率。(2) 实现双模型方案——流式使用 Conformer Transducer,离线使用序列到序列模型,或 alternatively,采用基于级联编码器的双 pass 模型。(3) 探索基于片段的 SOT(segSOT),该方法更适用于离线场景,同时也提高了多说话者转录的可读性。

关键词

引用

@article{arxiv.2506.14204,
  title  = {Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios},
  author = {Aswin Shanmugam Subramanian and Amit Das and Naoyuki Kanda and Jinyu Li and Xiaofei Wang and Yifan Gong},
  journal= {arXiv preprint arXiv:2506.14204},
  year   = {2025}
}

备注

Accepted to Interspeech 2025