VarArray 遇见 t-SOT:推进流式远场会话语音识别的最先进水平
音频与语音处理
2022-10-05 v2 计算与语言
声音
摘要
本文提出了一种新颖的流式自动语音识别(ASR)框架,用于处理由任意几何的远场麦克风阵列捕获的多说话人重叠语音。我们的框架称为 t-SOT-VA,利用了两项独立开发的近期技术:阵列几何无关的连续语音分离(即 VarArray)和基于 token 级序列化输出训练(t-SOT)的流式多说话人 ASR。为结合两项技术之优,我们新设计了一种基于 t-SOT 的 ASR 模型,该模型基于来自 VarArray 的两个分离语音信号生成序列化的多说话人转录。我们还提出了针对此类 ASR 模型的预训练方案,其中基于单声道单说话人 ASR 训练数据模拟 VarArray 的输出信号。使用 AMI 会议语料的会话转录实验表明,基于所提框架的系统显著优于传统系统。我们的系统在多远场麦克风设置下分别取得 AMI 开发集和评测集上 13.7% 和 15.5% 的 state-of-the-art 词错误率,同时保持流式推理能力。
引用
@article{arxiv.2209.04974,
title = {VarArray Meets t-SOT: Advancing the State of the Art of Streaming Distant Conversational Speech Recognition},
author = {Naoyuki Kanda and Jian Wu and Xiaofei Wang and Zhuo Chen and Jinyu Li and Takuya Yoshioka},
journal= {arXiv preprint arXiv:2209.04974},
year = {2022}
}
备注
6 pages, 2 figure, 3 tables, v2: Appendix A has been added