中文

GLAD:用于多说话人语音识别的全局-局部感知动态混合专家模型

声音 2026-03-20 v4

摘要

端到端多说话人语音识别(MTASR)面临着在准确转录重叠语音方面面临重大挑战。一个关键瓶颈是说话人特定的声学特征——这些特征对于区分重叠语音至关重要——往往在深层网络中被稀释。为此,我们提出了全局-局部感知动态混合专家(GLAD)体系结构。GLAD引入一种新型路由机制,动态融合说话人感知的全局上下文与细粒度的局部声学细节,以适应性地引导专家选择。在LibriSpeechMix和CH109数据集上的实验表明,GLAD显著优于基于序列化输出训练(SOT)的现有MTASR方法,在具有挑战性的高重叠场景中表现出卓越的鲁棒性。迄今为止,首次将全局-局部融合MoE策略应用于MTASR。

关键词

引用

@article{arxiv.2509.13093,
  title  = {GLAD: Global-Local Aware Dynamic Mixture-of-Experts for Multi-Talker ASR},
  author = {Yujie Guo and Jiaming Zhou and Yuhang Jia and Shiwan Zhao and Yong Qin},
  journal= {arXiv preprint arXiv:2509.13093},
  year   = {2026}
}

备注

This paper has been submitted to Interspeech 2026 for review