音系结构约束如何影响多语言与零样本 ASR 性能
音频与语音处理
2021-06-08 v2 计算与语言
声音
摘要
将多种语言的录音结合起来训练单一自动语音识别(ASR)模型的想法带来了通用语音表征涌现的希望。最近,一个 Transformer 编码器-解码器模型已被证明能在训练中所呈现语言的 IPA 转写中很好地利用多语言数据。然而,它学到的表征在零样本迁移到未见过的语言时并不成功。由于该模型缺乏对声学模型(AM)与语言模型(LM)的显式分解,尚不清楚其性能在多大程度上受发音差异或音系结构约束不匹配的影响。为了更深入地了解限制零样本 ASR 迁移的因素,我们用由独立 AM 和 LM 组成的混合 ASR 系统替换了编码器-解码器。然后,我们在一组 13 种语音多样的语言上对单语、多语和跨语言(零样本)声学及语言模型进行了广泛评估。我们表明,对跨语言音系结构约束建模带来的增益有限,且施加过强的模型会损害零样本迁移。此外,我们发现多语言 LM 会损害多语言 ASR 系统的性能,而在 LM 训练中仅保留目标语言的音系结构约束数据更为可取。
引用
@article{arxiv.2010.12104,
title = {How Phonotactics Affect Multilingual and Zero-shot ASR Performance},
author = {Siyuan Feng and Piotr Żelasko and Laureano Moro-Velázquez and Ali Abavisani and Mark Hasegawa-Johnson and Odette Scharenborg and Najim Dehak},
journal= {arXiv preprint arXiv:2010.12104},
year = {2021}
}
备注
Accepted for publication in IEEE ICASSP 2021. The first 2 authors contributed equally to this work