面向连续多说话人录音的端到端说话人归因ASR研究
音频与语音处理
2020-08-12 v1 计算与语言
声音
摘要
近来,一种端到端(E2E)说话人归因自动语音识别(SA-ASR)模型被提出,作为单声道重叠语音的说话人计数、语音识别与说话人识别的联合模型。它在由不同数量说话人组成的模拟语音混合上展示了有前景的结果。然而,该模型需要说话人声纹的先验知识以执行说话人识别,这极大限制了模型的应用。本文通过解决无可用说话人声纹的情况扩展了先前工作。具体而言,我们利用E2E SA-ASR模型的内部说话人表示进行说话人计数与聚类,从而对说话人名录中缺失声纹的说话人话语进行日记化(diarize)。我们还对E2E SA-ASR训练的参考标签提出简单修改,有助于良好处理连续多说话人录音。我们在单声道LibriCSS数据集上对原始E2E SA-ASR与所提方法进行了全面研究。与具备相关说话人声纹的原始E2E SA-ASR相比,所提方法在无任何先验说话人知识下取得了接近的性能。我们还展示了E2E SA-ASR模型中的源-目标注意力提供了假设起止时间的信息。
引用
@article{arxiv.2008.04546,
title = {Investigation of End-To-End Speaker-Attributed ASR for Continuous Multi-Talker Recordings},
author = {Naoyuki Kanda and Xuankai Chang and Yashesh Gaur and Xiaofei Wang and Zhong Meng and Zhuo Chen and Takuya Yoshioka},
journal= {arXiv preprint arXiv:2008.04546},
year = {2020}
}