中文

面向码切换语音识别的单语识别器融合

音频与语音处理 2022-11-03 v1 计算与语言 声音

摘要

双编码器结构在码切换(CS)自动语音识别(ASR)中已被深入研究。然而,大多数现有方法要求两个单语 ASR 模型(MAMs)的结构相同且仅使用 MAMs 的编码器。这导致预训练 MAMs 无法及时且充分地用于 CS ASR。本文提出一种面向 CS ASR 的单语识别器融合方法。它包含两个阶段:语音感知(SA)阶段与语言融合(LF)阶段。在 SA 阶段,声学特征通过两个独立的 MAMs 映射为两个语言相关的预测。为使 MAMs 专注于各自语言,我们进一步为 MAMs 扩展了语言感知训练策略。在 LF 阶段,BELM 融合两个语言相关预测以得到最终预测。此外,我们提出一种文本模拟策略以简化 BELM 的训练过程并减少对 CS 数据的依赖。在汉英混合语料上的实验显示了所提方法的有效性。使用开源预训练 MAMs 后,测试集上的混合错误率显著降低。

关键词

引用

@article{arxiv.2211.01046,
  title  = {Monolingual Recognizers Fusion for Code-switching Speech Recognition},
  author = {Tongtong Song and Qiang Xu and Haoyu Lu and Longbiao Wang and Hao Shi and Yuqin Lin and Yanbing Yang and Jianwu Dang},
  journal= {arXiv preprint arXiv:2211.01046},
  year   = {2022}
}

备注

Submitted to ICASSP2023