中文

面向长时多说话人录音的端到端说话人归属语音识别的假设拼接器

声音 2021-01-07 v1 计算与语言 音频与语音处理

摘要

近期提出了一种端到端(E2E)说话人归属自动语音识别(SA-ASR)模型,用于联合执行说话人计数、语音识别和说话人辨识。该模型在包含未知数量说话人的单声道重叠语音上取得了较低的说话人归属词错误率(SA-WER)。然而,E2E建模方法易受训练与测试条件失配的影响。尚待研究的是,E2E SA-ASR模型对于比训练时所见样本长得多的录音是否依然表现良好。在本工作中,我们首先将一种为长时音频单说话人ASR开发的已知解码技术应用于我们的E2E SA-ASR任务。随后,我们提出一种使用序列到序列模型的新方法,称为假设拼接器(hypothesis stitcher)。该模型接收从原始长时输入中提取的短音频片段所获得的多个假设,并输出融合后的单一假设。我们提出了假设拼接器模型的若干架构变体,并与传统解码方法进行比较。使用LibriSpeech和LibriCSS语料库的 experiments 表明,所提方法显著改善了SA-WER,尤其针对长时多说话人录音。

关键词

引用

@article{arxiv.2101.01853,
  title  = {Hypothesis Stitcher for End-to-End Speaker-attributed ASR on Long-form Multi-talker Recordings},
  author = {Xuankai Chang and Naoyuki Kanda and Yashesh Gaur and Xiaofei Wang and Zhong Meng and Takuya Yoshioka},
  journal= {arXiv preprint arXiv:2101.01853},
  year   = {2021}
}

备注

Submitted to ICASSP 2021