基于词元级说话人嵌入的流式说话人归属语音识别
音频与语音处理
2022-07-18 v2 计算与语言
声音
摘要
本文提出一种流式说话人归属自动语音识别(SA-ASR)模型,该模型能够以低延迟识别“谁说了什么”,即使在多人同时说话时也是如此。我们的模型基于最近提出的词元级序列化输出训练(t-SOT),用于以流式方式转写多说话人语音。为了进一步识别说话人身份,我们提出了一种基于编码器-解码器的说话人嵌入提取器,能够为每一个被识别出的词元估计说话人表示,不仅可从非重叠语音中,也可从重叠语音中提取。所提出的说话人嵌入称为 t-vector,其与 t-SOT ASR 模型同步提取,从而能够以低延迟联合执行说话人识别(SID)或说话人日志(SD)与多说话人转写。我们使用 LibriSpeechMix 和 LibriCSS 语料库对所提模型在 ASR 与 SID/SD 联合任务上进行了评估。该模型相比先前的流式模型取得了显著更好的准确率,并展现出与最先进的离线 SA-ASR 模型相当甚至有时更优的结果。
引用
@article{arxiv.2203.16685,
title = {Streaming Speaker-Attributed ASR with Token-Level Speaker Embeddings},
author = {Naoyuki Kanda and Jian Wu and Yu Wu and Xiong Xiao and Zhong Meng and Xiaofei Wang and Yashesh Gaur and Zhuo Chen and Jinyu Li and Takuya Yoshioka},
journal= {arXiv preprint arXiv:2203.16685},
year = {2022}
}
备注
Accepted for presentation at Interspeech 2022