中文

适配多语言 ASR 模型以处理多说话人语音

音频与语音处理 2023-05-31 v1 计算与语言

摘要

最先进的大规模通用语音模型(USM)在多个领域和语言上展现出良好的自动语音识别(ASR)性能。然而,这些模型识别重叠语音仍具挑战,而重叠语音在会议对话中常见。我们提出一种将 USM 适配于多说话人 ASR 的方法。我们首先开发了一种增强版的序列化输出训练,以联合执行多说话人 ASR 与话语时间戳预测。即,我们同时预测所有说话人的 ASR 假设、统计说话人数量并估计话语时间戳。我们进一步引入一个轻量级适配器模块,以仅使用单一语言进行适配时仍能保持 USM 的多语言特性。使用 AMI 和 AliMeeting 语料库获得的实验结果表明,我们提出的方法将 USM 有效迁移为一个具备时间戳预测能力的强多语言多说话人 ASR 模型。

关键词

引用

@article{arxiv.2305.18747,
  title  = {Adapting Multi-Lingual ASR Models for Handling Multiple Talkers},
  author = {Chenda Li and Yao Qian and Zhuo Chen and Naoyuki Kanda and Dongmei Wang and Takuya Yoshioka and Yanmin Qian and Michael Zeng},
  journal= {arXiv preprint arXiv:2305.18747},
  year   = {2023}
}

备注

Accepted by Interspeech 2023