中文

用于重叠语音 ASR 模型微调的级联编码器

声音 2023-06-29 v1 音频与语音处理

摘要

多说话人语音识别(MT-ASR)已被证明可改善含多个说话人重叠话语语音的 ASR 性能。多说话人模型通常利用模拟或真实重叠语音数据集从头训练。另一方面,ASR 的趋势是使用从广泛任务域收集的大规模数据集训练基础模型。鉴于这些模型的规模及其跨多种域的良好泛化能力,考虑以基础模型增强多说话人能力的场景是合理的。本文提出了一种 MT-ASR 模型,其通过级联 RNN-T 编码器配置将训练良好的基础模型与多说话人掩码模型相结合。实验结果表明,相对于基线多说话人模型,该级联配置在重叠语音话语上提供了改进的 WER,且不牺牲基础模型在非重叠话语上可实现的性能。

关键词

引用

@article{arxiv.2306.16398,
  title  = {Cascaded encoders for fine-tuning ASR models on overlapped speech},
  author = {Richard Rose and Oscar Chang and Olivier Siohan},
  journal= {arXiv preprint arXiv:2306.16398},
  year   = {2023}
}