非自回归普通话-英语码切换语音识别
计算与语言
2021-10-05 v3
摘要
普通话-英语码切换(CS)在东亚和东南亚人群中频繁使用。然而,两种差异极大的语言在句内切换使得CS语音识别具有挑战性。同时,近期成功的非自回归(NAR)ASR模型消除了自回归(AR)模型所需的从左到右的束搜索解码,并取得了优异性能和快速推理速度,但尚未应用于普通话-英语CS语音识别。本文利用Mask-CTC NAR ASR框架解决CS语音识别问题。我们进一步提出将编码器的普通话输出目标改为拼音以加速编码器训练,并引入拼音到普通话解码器来学习上下文信息。此外,我们使用词嵌入标签平滑以上下文信息正则化解码器,并使用投影矩阵正则化来弥合编码器与解码器之间的差距。我们在SEAME语料库上评估了这些方法并取得了令人振奋的结果。
引用
@article{arxiv.2104.02258,
title = {Non-autoregressive Mandarin-English Code-switching Speech Recognition},
author = {Shun-Po Chuang and Heng-Jui Chang and Sung-Feng Huang and Hung-yi Lee},
journal= {arXiv preprint arXiv:2104.02258},
year = {2021}
}
备注
5 pages, 1 figure, Accepted by 2021 IEEE Automatic Speech Recognition and Understanding Workshop (ASRU2021)