中文

面向多说话人端到端 ASR 的扩展图时间分类

声音 2022-03-02 v1 计算与语言 音频与语音处理

摘要

基于图的时间分类(GTC)是连接主义时间分类损失的推广形式,最近被提出用于改进使用图监督的自动语音识别(ASR)系统。例如,GTC 最初用于将伪标签序列的 N-best 列表编码为图以进行半监督学习。在本文中,我们提出 GTC 的扩展,通过神经网络对标签及标签转移的后验进行建模,可应用于更广泛的任务。作为一个示例应用,我们将扩展的 GTC(GTC-e)用于多说话人语音识别任务。多说话人语音的转录与说话人信息由图表示,其中说话人信息与转移相关联,ASR 输出与节点相关联。使用 GTC-e,多说话人 ASR 建模变得与单说话人 ASR 建模非常相似,因为多个说话人的词符被按时间顺序识别为单一合并序列。为评估,我们在源自 LibriSpeech 的模拟多说话人语音数据集上实验,获得了接近该任务经典基准的有前景结果。

关键词

引用

@article{arxiv.2203.00232,
  title  = {Extended Graph Temporal Classification for Multi-Speaker End-to-End ASR},
  author = {Xuankai Chang and Niko Moritz and Takaaki Hori and Shinji Watanabe and Jonathan Le Roux},
  journal= {arXiv preprint arXiv:2203.00232},
  year   = {2022}
}

备注

To appear in ICASSP2022