基于 Conformer 的单通道音频目标说话人自动语音识别
声音
2023-08-11 v1 机器学习
音频与语音处理
摘要
我们提出 CONF-TSASR,一种用于单通道目标说话人自动语音识别(TS-ASR)的非自回归端到端时频域架构。该模型由基于 TitaNet 的说话人嵌入模块、基于 Conformer 的掩蔽模块以及 ASR 模块组成。这些模块被联合优化以转录目标说话人的语音,同时忽略其他说话人的语音。在训练中,我们使用连接时序分类(CTC)损失,并引入尺度不变频谱图重建损失以鼓励模型更好地从混合语音中分离目标说话人的频谱图。我们在 WSJ0-2mix-extr 上取得了最先进的目标说话人词错误率(TS-WER)(4.2%)。此外,我们首次报告了 WSJ0-3mix-extr(12.4%)、LibriSpeech2Mix(4.2%)和 LibriSpeech3Mix(7.6%)数据集上的 TS-WER,为 TS-ASR 建立了新的基准。所提出的模型将通过 NVIDIA NeMo 工具包开源。
引用
@article{arxiv.2308.05218,
title = {Conformer-based Target-Speaker Automatic Speech Recognition for Single-Channel Audio},
author = {Yang Zhang and Krishna C. Puvvada and Vitaly Lavrukhin and Boris Ginsburg},
journal= {arXiv preprint arXiv:2308.05218},
year = {2023}
}