面向自动语音识别的单通道语音分离实用方面研究
音频与语音处理
2021-07-06 v1 声音
摘要
语音分离因其处理重叠语音的能力以及可与自动语音识别(ASR)等下游任务灵活结合的特性,已成功作为对话转写系统的前端处理模块。然而,语音分离模型常引入目标语音失真,导致次优的词错误率(WER)。本文中,我们致力于提升单通道语音分离系统的性能。具体而言,我们研究了一种两阶段训练方案:首先应用特征级优化准则进行预训练,随后使用端到端(E2E)语音识别模型采用面向 ASR 的优化准则。同时,为保持模型轻量,我们引入一种改进的师生学习技术用于模型压缩。通过结合这些方法,在 LibriCSS 数据集上,相较于先前最优结果,我们以少于 10M 参数的模型在语句级评估与连续评估上分别取得了 2.70% 与 0.77% 的绝对平均 WER 提升。
引用
@article{arxiv.2107.01922,
title = {Investigation of Practical Aspects of Single Channel Speech Separation for ASR},
author = {Jian Wu and Zhuo Chen and Sanyuan Chen and Yu Wu and Takuya Yoshioka and Naoyuki Kanda and Shujie Liu and Jinyu Li},
journal= {arXiv preprint arXiv:2107.01922},
year = {2021}
}
备注
Accepted by Interspeech 2021