基于 Transformer 的端到端说话人归属语音识别
音频与语音处理
2021-04-07 v1 计算与语言
声音
摘要
本文介绍了我们在端到端说话人归属自动语音识别(ASR)方面的最新工作,该任务针对单声道多说话人音频联合执行说话人计数、语音识别和说话人识别。首先,我们通过应用 transformer 架构,对先前基于长短期记忆(LSTM)注意力编码器解码器设计的模型架构进行了全面更新。其次,我们提出了一种说话人去重机制,以减少高度重叠区域中的说话人识别错误。在 LibriSpeechMix 数据集上的实验结果表明,基于 transformer 的架构尤其擅长计数说话人,且所提模型相比基于 LSTM 的基线将说话人归属词错误率降低了47%。此外,对于由重叠语音真实录音组成的 LibriCSS 数据集,所提模型在有无目标说话人配置文件的情况下分别取得了11.9%和16.3%的拼接最小置换词错误率,两者均为 LibriCSS 在单声道设置下的当前最优结果。
引用
@article{arxiv.2104.02128,
title = {End-to-End Speaker-Attributed ASR with Transformer},
author = {Naoyuki Kanda and Guoli Ye and Yashesh Gaur and Xiaofei Wang and Zhong Meng and Zhuo Chen and Takuya Yoshioka},
journal= {arXiv preprint arXiv:2104.02128},
year = {2021}
}
备注
Submitted to INTERSPEECH 2021