中文

侧车分离器可将单说话人语音识别系统转换为多说话人系统

声音 2023-03-07 v2 人工智能 计算与语言 机器学习 音频与语音处理

摘要

尽管自动语音识别(ASR)在常见的非重叠环境中表现良好,但在多说话人重叠语音识别中保持性能仍具挑战性。近期研究揭示,ASR 模型的编码器在不同层捕获不同层次的信息——较低层往往具有更多声学信息,较高层更多语言信息。这启发我们开发一种侧车(Sidecar)分离器,通过在两个合适层之间分离混合语音嵌入,使训练良好的 ASR 模型具备多说话人场景能力。我们以挂载 Sidecar 的基于 wav2vec 2.0 的 ASR 模型进行了实验。通过冻结原始模型参数并仅训练 Sidecar(8.7 M,占全部参数的 8.4%),所提方法在 2 说话人混合 LibriMix 数据集上大幅优于先前最优(SOTA),词错误率(WER)达到 10.36%;并在有限训练下于 LibriSpeechMix 数据集上取得可比结果(7.56%)。

关键词

引用

@article{arxiv.2302.09908,
  title  = {A Sidecar Separator Can Convert a Single-Talker Speech Recognition System to a Multi-Talker One},
  author = {Lingwei Meng and Jiawen Kang and Mingyu Cui and Yuejiao Wang and Xixin Wu and Helen Meng},
  journal= {arXiv preprint arXiv:2302.09908},
  year   = {2023}
}

备注

Accepted by IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP), 2023