中文

无监督单通道重叠语音识别中的渐进式联合建模

计算与语言 2017-12-27 v2 人工智能

摘要

无监督单通道重叠语音识别是自动语音识别(ASR)中最困难的问题之一。排列不变训练(PIT)是一种基于模型的 SOTA 方法,它应用单个神经网络来解决这一单输入多输出建模问题。我们提议通过对神经网络施加模块化结构、采用渐进式预训练方案,以及利用迁移学习和判别式训练准则改进目标函数,来推进当前的 SOTA。模块化结构将问题分解为三个子任务:帧级解释、话语级说话人追踪和语音识别。预训练方案利用这些模块来逐步解决更难的任务。迁移学习利用并行纯净语音来改进网络的训练目标。我们的判别式训练公式是对标准公式的修改,同时惩罚系统的竞争输出。实验在人工重叠的 Switchboard 和 hub5e-swb 数据集上进行。所提框架相对于强联合训练系统(用于 ASR 的 PIT)和单独优化系统(用于语音分离的 PIT 结合纯净语音 ASR 模型),实现了超过 30% 的 WER 相对改进。该改进源于更好的模型泛化能力、训练效率以及序列级语言学知识的整合。

关键词

引用

@article{arxiv.1707.07048,
  title  = {Progressive Joint Modeling in Unsupervised Single-channel Overlapped Speech Recognition},
  author = {Zhehuai Chen and Jasha Droppo and Jinyu Li and Wayne Xiong},
  journal= {arXiv preprint arXiv:1707.07048},
  year   = {2017}
}

备注

submitted to TASLP, 07/20/2017; accepted by TASLP, 10/13/2017