中文

单声道长音频说话人归属 ASR 中模块化与联合方法的比较研究

音频与语音处理 2021-09-21 v2 计算与语言 声音

摘要

说话人归属自动语音识别(SA-ASR)是从多说话人录音中识别“谁说了什么”的任务。一个 SA-ASR 系统通常由语音分离、说话人日记化和 ASR 等多个模块组成。另一方面,考虑到联合优化,近期提出了一种端到端(E2E)SA-ASR 模型,在仿真数据上取得了有前景的结果。本文中,我们介绍了近期关于真实单声道录音上 SA-ASR 的模块化与联合方法比较的研究。我们利用大规模训练数据,包括 7.5 万小时 ASR 训练数据和用于说话人表征学习的 VoxCeleb 语料库,为模块化与联合方法开发了最先进的 SA-ASR 系统。我们还提出了一种在说话人聚类后执行 E2E SA-ASR 模型的新流程。我们在 AMI 会议语料库上的评估显示,在使用少量真实数据微调后,联合系统相比最佳模块化系统在准确率上高出 8.9%–29.9%,而模块化系统在微调前表现更好。我们还进行了多种错误分析以揭示单声道 SA-ASR 的遗留问题。

关键词

引用

@article{arxiv.2107.02852,
  title  = {A Comparative Study of Modular and Joint Approaches for Speaker-Attributed ASR on Monaural Long-Form Audio},
  author = {Naoyuki Kanda and Xiong Xiao and Jian Wu and Tianyan Zhou and Yashesh Gaur and Xiaofei Wang and Zhong Meng and Zhuo Chen and Takuya Yoshioka},
  journal= {arXiv preprint arXiv:2107.02852},
  year   = {2021}
}

备注

To appear in ASRU 2021