中文

面向噪声和混响多说话人自动语音识别的语音分离模型无转录微调

声音 2024-06-14 v1 机器学习 音频与语音处理

摘要

重叠说话人自动语音识别(ASR)的一种解决方案是分离语音,然后对分离后的信号进行ASR。通常,分离器会产生伪影,这往往会降低ASR性能。解决此问题通常需要参考转录文本来联合训练分离和ASR网络。这对于在真实世界领域内音频上进行训练通常不可行,因为参考转录信息并不总是可用。本文提出了一种仅使用音频信号进行联合训练的无转录方法。所提出的方法使用预训练ASR编码器的嵌入差异作为损失函数,并采用一种称为引导式排列不变训练(GPIT)的改进排列不变训练(PIT)方法。该方法在词错误率(WER)指标上比信号级损失提高了6.4%,并且在感知指标(如短时客观可懂度(STOI))上也显示出增强改进。

关键词

引用

@article{arxiv.2406.08914,
  title  = {Transcription-Free Fine-Tuning of Speech Separation Models for Noisy and Reverberant Multi-Speaker Automatic Speech Recognition},
  author = {William Ravenscroft and George Close and Stefan Goetze and Thomas Hain and Mohammad Soleymanpour and Anurag Chowdhury and Mark C. Fuhs},
  journal= {arXiv preprint arXiv:2406.08914},
  year   = {2024}
}

备注

5 pages, 3 Figures, 3 Tables, Accepted for Interspeech 2024