中文

面向自动语音识别的单通道语音分离实用方面研究

音频与语音处理 2021-07-06 v1 声音

摘要

语音分离因其处理重叠语音的能力以及可与自动语音识别(ASR)等下游任务灵活结合的特性,已成功作为对话转写系统的前端处理模块。然而,语音分离模型常引入目标语音失真,导致次优的词错误率(WER)。本文中,我们致力于提升单通道语音分离系统的性能。具体而言,我们研究了一种两阶段训练方案:首先应用特征级优化准则进行预训练,随后使用端到端(E2E)语音识别模型采用面向 ASR 的优化准则。同时,为保持模型轻量,我们引入一种改进的师生学习技术用于模型压缩。通过结合这些方法,在 LibriCSS 数据集上,相较于先前最优结果,我们以少于 10M 参数的模型在语句级评估与连续评估上分别取得了 2.70% 与 0.77% 的绝对平均 WER 提升。

关键词

引用

@article{arxiv.2107.01922,
  title  = {Investigation of Practical Aspects of Single Channel Speech Separation for ASR},
  author = {Jian Wu and Zhuo Chen and Sanyuan Chen and Yu Wu and Takuya Yoshioka and Naoyuki Kanda and Shujie Liu and Jinyu Li},
  journal= {arXiv preprint arXiv:2107.01922},
  year   = {2021}
}

备注

Accepted by Interspeech 2021