中文

面向联合端到端多说话人重叠语音识别与说话人属性估计的统一自回归建模

计算与语言 2021-07-06 v1 声音 音频与语音处理

摘要

本文提出一种用于单通道多说话人重叠自动语音识别(ASR)系统的新颖建模方法。全神经网络端到端模型已显著提升了多说话人重叠 ASR 任务的性能。一种有前景的端到端建模方法是采用序列化输出训练的自回归建模,其中多个说话人的转写文本被递归地依次生成。这使我们能够自然地捕捉说话人之间的关系。然而,传统建模方法无法显式考虑各话语的说话人属性(如性别与年龄信息)。事实上,当各说话人性别相同或年龄相近时,性能会下降。为解决该问题,我们提出用于联合端到端多说话人重叠 ASR 与说话人属性估计的统一自回归建模。我们的核心思想是在统一自回归建模中处理性别与年龄估计任务。在所提方法中,基于 transformer 的自回归模型不仅递归生成文本 token,还生成各说话人的属性 token。这使我们能有效利用说话人属性来改进多说话人重叠 ASR。在日语多说话人重叠 ASR 任务上的实验证明了该方法的有效性。

关键词

引用

@article{arxiv.2107.01549,
  title  = {Unified Autoregressive Modeling for Joint End-to-End Multi-Talker Overlapped Speech Recognition and Speaker Attribute Estimation},
  author = {Ryo Masumura and Daiki Okamura and Naoki Makishima and Mana Ihori and Akihiko Takashima and Tomohiro Tanaka and Shota Orihashi},
  journal= {arXiv preprint arXiv:2107.01549},
  year   = {2021}
}

备注

Accepted at Interspeech 2021