中文

面向码切换语音识别的语言特性辅助方法

计算与语言 2022-07-13 v3 音频与语音处理

摘要

双编码器结构成功利用两个语言特定编码器(LSEs)进行码切换语音识别。由于LSEs由两个预训练的语言特定模型(LSMs)初始化,双编码器结构可利用充足的单语数据并捕获独立语言属性。然而,多数现有方法对LSEs无语言约束且未充分利用LSMs的语言特定知识。本文提出一种语言特性辅助(LSCA)方法以缓解上述问题。具体而言,训练期间我们引入两个语言特定损失作为语言约束并为其生成相应语言特定目标。解码期间,我们综合考虑LSMs的解码能力,通过结合两个LSMs与混合模型的输出概率获得最终预测。实验表明,LSCA的训练或解码方法均可提升模型性能。此外,结合LSCA的训练与解码方法在码切换测试集上可获得高达15.4%的相对错误率降低。而且,基于两个预训练LSMs,利用我们的方法,系统无需额外共享参数甚至无需重训练即可良好处理码切换语音识别任务。

关键词

引用

@article{arxiv.2206.14580,
  title  = {Language-specific Characteristic Assistance for Code-switching Speech Recognition},
  author = {Tongtong Song and Qiang Xu and Meng Ge and Longbiao Wang and Hao Shi and Yongjie Lv and Yuqin Lin and Jianwu Dang},
  journal= {arXiv preprint arXiv:2206.14580},
  year   = {2022}
}

备注

Accepted by Interspeech 2022