面向噪声和混响多说话人自动语音识别的语音分离模型无转录微调
声音
2024-06-14 v1 机器学习
音频与语音处理
摘要
重叠说话人自动语音识别(ASR)的一种解决方案是分离语音,然后对分离后的信号进行ASR。通常,分离器会产生伪影,这往往会降低ASR性能。解决此问题通常需要参考转录文本来联合训练分离和ASR网络。这对于在真实世界领域内音频上进行训练通常不可行,因为参考转录信息并不总是可用。本文提出了一种仅使用音频信号进行联合训练的无转录方法。所提出的方法使用预训练ASR编码器的嵌入差异作为损失函数,并采用一种称为引导式排列不变训练(GPIT)的改进排列不变训练(PIT)方法。该方法在词错误率(WER)指标上比信号级损失提高了6.4%,并且在感知指标(如短时客观可懂度(STOI))上也显示出增强改进。
引用
@article{arxiv.2406.08914,
title = {Transcription-Free Fine-Tuning of Speech Separation Models for Noisy and Reverberant Multi-Speaker Automatic Speech Recognition},
author = {William Ravenscroft and George Close and Stefan Goetze and Thomas Hain and Mohammad Soleymanpour and Anurag Chowdhury and Mark C. Fuhs},
journal= {arXiv preprint arXiv:2406.08914},
year = {2024}
}
备注
5 pages, 3 Figures, 3 Tables, Accepted for Interspeech 2024