基于联合随机逼近的无音素词典跨语言语音识别
音频与语音处理
2025-12-17 v2 人工智能
计算与语言
摘要
最近的预训练模型在跨语言语音识别中显示出数据效率高和跨语言信息共享优势,但局限于需要音素发音词典。本研究旨在消除对发音词典的需求,提出一种基于隐变量模型的方法,将音素视为离散隐变量。该方法由语音到音素 (S2P) 模型和音素到字母 (P2G) 模型组成,并引入字母到音素 (G2P) 模型作为辅助推断模型。为联合训练这三个模型,我们利用联合随机逼近 (JSA) 算法,这是一种 EM (期望最大化) 算法的随机扩展方法,在估计离散隐变量模型方面表现优异。此外,我们提出了边际似然评分 (MLS) 解码以对齐推断与训练目标,并通过 P2G 增强提高了 P2G 映射的鲁棒性。基于 Whistle 多语言预训练 S2P 模型,在波兰语 (130 小时) 和印尼语 (20 小时) 进行跨语言实验。仅使用 10 分钟的音素监督,新的方法 JSA-SPG 相比使用子词或完整音素监督的最佳跨语言微调方法实现了 5% 的错误率降低。此外,发现在语言领域适应 (即利用跨域文本-only 数据) 时,JSA-SPG 通过 G2P 模型的辅助作用,比标准的语言模型融合做法实现了 9% 的错误率降低。为促进可重复性并鼓励在该领域进一步探索,我们开源了 JSA-SPG 训练代码和完整管道。
引用
@article{arxiv.2507.06249,
title = {Pronunciation-Lexicon Free Training for Phoneme-based Crosslingual ASR via Joint Stochastic Approximation},
author = {Saierdaer Yusuyin and Te Ma and Hao Huang and Zhijian Ou},
journal= {arXiv preprint arXiv:2507.06249},
year = {2025}
}
备注
Accepted by IEEE TASLP