优化双阶段跨语言迁移学习:音素识别与音素到字素转换
计算与语言
2023-12-07 v1 声音
音频与语音处理
摘要
本研究通过增强音素识别和音素到字素转换模型,优化了低资源语言中的双阶段跨语言迁移学习。我们的方法优化了这两个阶段,以改进跨语言的语音识别。我们通过基于共享的发音特征合并音素来优化音素词汇覆盖率,从而提高识别准确率。此外,我们引入了一个全局音素噪声生成器,用于在音素到字素转换训练期间生成逼真的自动语音识别噪声,以减少误差传播。在 CommonVoice 12.0 数据集上的实验表明,低资源语言的词错误率显著降低,突显了我们方法的有效性。这项研究为低资源语言中双阶段自动语音识别系统的进步做出了贡献,为改进跨语言迁移学习提供了潜力。
引用
@article{arxiv.2312.03312,
title = {Optimizing Two-Pass Cross-Lingual Transfer Learning: Phoneme Recognition and Phoneme to Grapheme Translation},
author = {Wonjun Lee and Gary Geunbae Lee and Yunsu Kim},
journal= {arXiv preprint arXiv:2312.03312},
year = {2023}
}
备注
8 pages, ASRU 2023 Accepted