中文

基于 Whisper 的目标说话人语音识别

音频与语音处理 2025-01-17 v2 声音

摘要

我们提出了一种新方法,使大型单说话人语音识别模型(如Whisper)可用于目标说话人语音识别。该方法的关键论点是,通过学习条件化帧级说话人分割输出来建模说话人之间的相对差异,比学习所有说话人嵌入空间要容易得多。我们发现,仅在每个说话人分割输出类型之前添加一个偏置项,即可将单说话人语音识别模型转换为目标说话人语音识别模型。我们的方法还支持带说话人属性的语音识别,通过依次生成说话人分割输出中每个说话人的转录。这种简化方法在NOTSOFAR-1数据集上,相对于基线语音分离和说话人分割级联方法,实现了12.9%的绝对ORC-WER提升。

关键词

引用

@article{arxiv.2409.09543,
  title  = {Target Speaker ASR with Whisper},
  author = {Alexander Polok and Dominik Klement and Matthew Wiesner and Sanjeev Khudanpur and Jan Černocký and Lukáš Burget},
  journal= {arXiv preprint arXiv:2409.09543},
  year   = {2025}
}

备注

Accepted to ICASSP 2025