中文

面向单远场麦克风会议转写的大规模端到端多说话人 ASR 预训练

音频与语音处理 2021-04-14 v3 计算与语言 声音

摘要

仅使用单个远场麦克风(SDM)转写包含重叠语音的会议一直是自动语音识别(ASR)中最具挑战性的问题之一。尽管已提出多种方法,以往所有关于单声道重叠语音识别的研究均基于仿真数据或小规模真实数据。在本文中,我们深入研究了两步法:首先利用大规模仿真数据预训练基于序列化输出训练(SOT)的多说话人 ASR,然后使用少量真实会议数据对模型进行微调。实验利用我们内部 7.5 万(K)小时单说话人录音,仿真出总计 90 万小时的多说话人音频片段用于监督预训练。在 AMI-SDM 训练数据 70 小时上微调后,我们的 SOT ASR 模型在 AMI-SDM 评估集上取得了 21.2% 的词错误率(WER),同时自动统计每个测试段中的说话人数量。该结果不仅显著优于此前利用神谕语句边界信息的最先进 WER 36.4%,也优于类似微调的单说话人 ASR 模型应用于波束成形音频的结果。

关键词

引用

@article{arxiv.2103.16776,
  title  = {Large-Scale Pre-Training of End-to-End Multi-Talker ASR for Meeting Transcription with Single Distant Microphone},
  author = {Naoyuki Kanda and Guoli Ye and Yu Wu and Yashesh Gaur and Xiaofei Wang and Zhong Meng and Zhuo Chen and Takuya Yoshioka},
  journal= {arXiv preprint arXiv:2103.16776},
  year   = {2021}
}

备注

Submitted to INTERSPEECH 2021