基于模型的无监督端到端无栅格最大互信息模型说话人自适应用于语音识别
音频与语音处理
2023-01-09 v2 声音
摘要
对说话人差异建模是自动语音识别(ASR)系统的关键挑战。本文采用基于学习隐单元贡献(LHUC)且具有紧凑说话人相关(SD)参数的自适应技术,以促进端到端(E2E)无栅格最大互信息(LF-MMI)模型的说话人自适应训练(SAT)与无监督测试时说话人自适应。提出一种基于模型的无监督自适应框架,利用 LF-MMI 与交叉熵(CE)准则在 E2E 范式下估计 SD 参数。系统地研究了标准 LHUC 自适应的多种正则化方法(如贝叶斯 LHUC(BLHUC)自适应)以缓解过拟合风险,应用于 E2E LF-MMI CNN-TDNN 与 CNN-TDNN-BLSTM 模型。基于栅格的置信度评分估计用于自适应数据筛选,以降低监督标签不确定性。在 300 小时 Switchboard 任务上的实验表明,在所提出的无监督 E2E 自适应框架中应用 BLHUC 于基于字节对编码(BPE)的 E2E LF-MMI 系统,相较基线系统在 NIST Hub5'00 与 RT03 评测集上分别取得高达 10.5% 与 14.7% 的相对词错误率(WER)降低,并分别达到 9.0% 与 9.7% 的最佳 WER。这些结果可与最先进的自适应 LF-MMI 混合系统及自适应 Conformer 基 E2E 系统的结果相媲美。
引用
@article{arxiv.2211.09313,
title = {Unsupervised Model-based speaker adaptation of end-to-end lattice-free MMI model for speech recognition},
author = {Xurong Xie and Xunying Liu and Hui Chen and Hongan Wang},
journal= {arXiv preprint arXiv:2211.09313},
year = {2023}
}
备注
6 pages, 2 figures, submitted to ICASSP 2023