中文

基于令牌级序列化输出训练的流式多说话人语音识别

音频与语音处理 2022-07-18 v5 计算与语言 声音

摘要

本文提出令牌级序列化输出训练(t-SOT),一种用于流式多说话人自动语音识别(ASR)的新框架。与现有使用多个输出分支的流式多说话人 ASR 模型不同,t-SOT 模型仅有一个单一输出分支,该分支根据多个说话人的发出时间按时间顺序生成识别令牌(如词、子词)。引入一个指示“虚拟”输出通道切换的特殊令牌来跟踪重叠话语。与先前的流式多说话人 ASR 模型相比,t-SOT 模型具有推理成本更低和模型架构更简单的优势。此外,在我们对 LibriSpeechMix 和 LibriCSS 数据集的实验中,基于 t-SOT 的 transformer transducer 模型以显著优势超越了先前结果,取得了最先进的词错误率。对于非重叠语音,t-SOT 模型在准确率和计算成本上均与单说话人 ASR 模型相当,为部署单一模型同时用于单说话人和多说话人场景打开了大门。

关键词

引用

@article{arxiv.2202.00842,
  title  = {Streaming Multi-Talker ASR with Token-Level Serialized Output Training},
  author = {Naoyuki Kanda and Jian Wu and Yu Wu and Xiong Xiao and Zhong Meng and Xiaofei Wang and Yashesh Gaur and Zhuo Chen and Jinyu Li and Takuya Yoshioka},
  journal= {arXiv preprint arXiv:2202.00842},
  year   = {2022}
}

备注

6 pages, 1 figure, 7 tables, v2: minor fixes, v3: Appendix D has been added, v4: citation to [27] has been added, v5: citations to [28][29][30] have been added with minor fixes, short version accepted for presentation at Interspeech 2022