面向低资源多语言声学模型融合的非线性成对语言映射
计算与语言
2022-07-08 v1 音频与语音处理
摘要
多语言语音识别作为一种补偿低资源语言数据稀缺的有效方式已引起显著关注。端到端(e2e)建模相较于传统混合系统更受青睐,主要因其无需词典。然而,在有限数据场景下,混合 DNN-HMM 仍优于 e2e 模型。此外,对于许多语言,公开可用的训练好的字素到音素(G2P)及文本到 IPA 音译模型已缓解了人工词典构建的问题。本文提出一种在多语言设置下针对低资源语言的混合 DNN-HMM 声学模型融合新方法。针对目标语言语音信号,将来自不同单语声学模型的后验分布融合在一起。为每个源-目标语言对训练一个独立的回归神经网络,以将后验从源声学模型变换到目标语言。这些网络相较于 ASR 训练所需数据非常有限。与多语言和单语基线相比,后验融合分别取得了 14.65% 和 6.5% 的相对增益。跨语言模型融合表明,在不使用依赖于语言的 ASR 后验的情况下也可取得可比结果。
引用
@article{arxiv.2207.03391,
title = {Non-Linear Pairwise Language Mappings for Low-Resource Multilingual Acoustic Model Fusion},
author = {Muhammad Umar Farooq and Darshan Adiga Haniya Narayana and Thomas Hain},
journal= {arXiv preprint arXiv:2207.03391},
year = {2022}
}
备注
Accepted for Interspeech 2022