基于字素单元与辅助单语损失的双语流式 ASR
音频与语音处理
2023-08-15 v1 计算与语言
声音
摘要
我们提出了一种双语方案,以在混合自动语音识别(ASR)设置中为主流语言区域支持英语作为次要区域。我们的关键进展包括:(a) 使用字素单元而非音素单元的发音词典;(b) 一个完全双语的对齐模型及随后的双语流式 transformer 模型;(c) 带有语言识别(LID)损失的并行编码器结构;(d) 带有用于单语投影的辅助损失的并行编码器。我们得出结论:与 LID 损失相比,我们提出的辅助损失更优,能使并行编码器专门化于各自的单语区域,这有助于更强的双语学习。我们在针对双语西班牙语(ES)与双语意大利语(IT)应用的大规模训练与测试任务上评估了我们的工作。我们的双语模型展现出强大的英语码混能力。特别地,双语 IT 模型将码混 IT 任务的词错误率(WER)从 46.5% 提升至 13.8%,同时在 IT 测试上也与单语 IT 模型(9.5%)接近持平(9.6%)。
引用
@article{arxiv.2308.06327,
title = {Bilingual Streaming ASR with Grapheme units and Auxiliary Monolingual Loss},
author = {Mohammad Soleymanpour and Mahmoud Al Ismail and Fahimeh Bahmaninezhad and Kshitiz Kumar and Jian Wu},
journal= {arXiv preprint arXiv:2308.06327},
year = {2023}
}