中文

PM-MMUT:基于多建模单元训练的电话掩码数据增强以提升抗语音弱化的端到端语音识别

声音 2022-07-05 v3 计算与语言 音频与语音处理

摘要

辅音和元音弱化在语音中常出现,可能导致自动语音识别(ASR)性能下降。我们近期提出的基于掩码的学习策略——电话掩码训练(PMT)——缓解了此类现象在维吾尔语 ASR 中的影响。尽管 PMT 取得了显著改进,但由于 PMT 的掩码单元(音素)与建模单元(word-piece)之间的粒度不匹配,仍存在进一步提升空间。为提升 PMT 性能,我们提出多建模单元训练(MMUT)架构与 PMT 融合(PM-MMUT)。MMUT 框架的思想是将编码器分为两部分:声学特征序列到音素级表征(AF-to-PLR)和音素级表征到 word-piece 级表征(PLR-to-WPLR)。它允许 AF-to-PLR 由基于音素的中间 CTC 损失优化,以学习 PMT 带来的丰富音素级上下文信息。在维吾尔语 ASR 上的实验结果表明,所提方法明显优于纯 PMT。我们还在 960 小时 Librispeech 基准上使用 ESPnet1 进行了实验,与最新官方 ESPnet1 预训练模型相比,在不使用 LM 融合的情况下所有测试集相对 WER 降低约 10%。

关键词

引用

@article{arxiv.2112.06721,
  title  = {PM-MMUT: Boosted Phone-Mask Data Augmentation using Multi-Modeling Unit Training for Phonetic-Reduction-Robust E2E Speech Recognition},
  author = {Guodong Ma and Pengfei Hu and Nurmemet Yolwas and Shen Huang and Hao Huang},
  journal= {arXiv preprint arXiv:2112.06721},
  year   = {2022}
}

备注

Accepted to INTERSPEECH 2022