赋能 Whisper:联合多说话者与目标说话者语音识别系统
声音
2024-08-27 v2 计算与语言
音频与语音处理
摘要
多说话者语音识别与目标说话者语音识别均涉及多说话者环境中的转录任务,仍是重要挑战。然而,现有方法很少尝试同时解决这两项任务。本研究提出了一种开创性方法,赋能作为语音基础模型的 Whisper,来解决联合多说话者与目标说话者语音识别任务。具体而言,(i) 我们冻结 Whisper,并在其编码器中插入侧车分离器用于分离多个说话者的混合嵌入;(ii) 引入目标说话者识别器用于实时识别目标说话者的嵌入流动,仅需三秒的注册语音作为提示;(iii) 探索解码器的软提示调优以实现更好的任务适应。我们的方法在 LibriMix 和 LibriSpeechMix 两人和三人数据集上优于先前方法,同时在 AishellMix 中文多说话者语音识别数据集上也能实现可接受的零样本性能。
引用
@article{arxiv.2407.09817,
title = {Empowering Whisper as a Joint Multi-Talker and Target-Talker Speech Recognition System},
author = {Lingwei Meng and Jiawen Kang and Yuejiao Wang and Zengrui Jin and Xixin Wu and Xunying Liu and Helen Meng},
journal= {arXiv preprint arXiv:2407.09817},
year = {2024}
}
备注
Accepted to INTERSPEECH 2024