中文

MoME:用于音视频语音识别的Matryoshka专家混合模型

音频与语音处理 2025-10-07 v1 计算机视觉与模式识别 声音

摘要

大语言模型(LLM)最近在音视频语音识别(AVSR)中显示出强大的潜力,但其高计算需求和对标记细粒度的敏感性限制了在资源受限环境中的实际应用。标记压缩方法可降低推理成本,但需要提前固定压缩率并产生单一固定长度的输出,无法在推理时灵活平衡信息密度与效率。Matryoshka表征学习(MRL)通过使单个模型能够在多个标记细粒度之间运行来解决这一问题,允许动态调整压缩率。然而,当前的MRL方法在训练时将每个尺度独立处理,限制了跨尺度的泛化、高压缩下的鲁棒性以及可解释性。为克服这些限制,我们提出MoME(Mixture of Matryoshka Experts),这是一种新型框架,将稀疏Mixture-of-Experts(MoE)集成到MRL-based LLMs中用于AVSR。MoME将冻结的LLM与顶部路由和共享专家相结合,实现跨尺度和跨模态的动态容量分配。共享路由器促进跨细粒度的一致专家激活,使压缩序列能够从较低压缩率下学习的表征中受益。在LRS2和LRS3上的实验表明,MoME在AVSR、ASR和VSR任务上实现了最先进的性能,同时显著减少参数数量并在噪声环境下保持鲁棒性。MoME统一了MRL的可适应性与MoE的效率,为资源感知的语音识别提供了可扩展且可解释的解决方案。

关键词

引用

@article{arxiv.2510.04136,
  title  = {MoME: Mixture of Matryoshka Experts for Audio-Visual Speech Recognition},
  author = {Umberto Cappellazzo and Minsu Kim and Pingchuan Ma and Honglie Chen and Xubo Liu and Stavros Petridis and Maja Pantic},
  journal= {arXiv preprint arXiv:2510.04136},
  year   = {2025}
}

备注

NeurIPS 2025