中文

基于中间CTC监督的专家混合模型用于口音语音识别

计算与语言 2026-02-03 v1 人工智能

摘要

口音语音对自动语音识别(ASR)而言仍是一个持续挑战,因为大多数模型是在以少数高资源英语变体为主的数据上训练的,导致对其他口音的性能大幅下降。与口音无关的方法提高了鲁棒性,但在重度口音或未见变体上仍显不足,而与口音相关的方法则依赖于有限且常含噪声的标签。我们引入了Moe-Ctc,一种带有中间CTC监督的专家混合架构,共同促进专家特化与泛化。在训练期间,口音感知路由鼓励专家捕获口音特定模式,并逐渐过渡到无标签路由以用于推理。每个专家配备其自身的CTC头,以将路由与转录质量对齐,而路由增强损失进一步稳定优化。在Mcv-Accent基准上的实验表明,在低资源和高资源条件下,对已见和未见口音均取得了一致的改进,相较于强FastConformer基线,相对词错误率(WER)降低最高达29.3%。

关键词

引用

@article{arxiv.2602.01967,
  title  = {Mixture-of-Experts with Intermediate CTC Supervision for Accented Speech Recognition},
  author = {Wonjun Lee and Hyounghun Kim and Gary Geunbae Lee},
  journal= {arXiv preprint arXiv:2602.01967},
  year   = {2026}
}