减少端到端语码转换自动语音识别的语言上下文混淆
计算与语言
2022-06-30 v4 声音
音频与语音处理
摘要
语码转换涉及交际过程中交替使用的语言。训练用于语码转换的端到端(E2E)自动语音识别(ASR)系统尤其具有挑战性,因为语码转换训练数据总是不足以应对因存在多种语言而增加的 multilingual 上下文混淆。我们提出一种与语言相关的注意力机制,基于等价约束(EC)理论来减少 E2E 语码转换 ASR 模型的多语言上下文混淆。该语言学理论要求,出现在语码转换句子中的任何单语片段必须出现在某个单语句子中。该理论在单语数据与语码转换数据之间建立了桥梁。我们利用这一语言学理论来设计语码转换 E2E ASR 模型。所提模型高效地将语言知识从丰富的单语数据迁移,以提升语码转换 ASR 模型的性能。我们在 ASRU 2019 中英混话语码转换挑战数据集上评估了我们的模型。相较于基线模型,我们所提模型实现了 17.12% 的相对错误率降低。
引用
@article{arxiv.2201.12155,
title = {Reducing language context confusion for end-to-end code-switching automatic speech recognition},
author = {Shuai Zhang and Jiangyan Yi and Zhengkun Tian and Jianhua Tao and Yu Ting Yeung and Liqun Deng},
journal= {arXiv preprint arXiv:2201.12155},
year = {2022}
}
备注
arXiv admin note: text overlap with arXiv:2010.14798,the paper has been accepted by Insterspeech 2022