中文

扩增与优化基于LLM的音视频语音识别:稀疏混合投影器方法

音频与语音处理 2025-05-22 v2 计算机视觉与模式识别 多媒体 声音

摘要

音视频语音识别(AVSR)通过整合视觉线索在噪声环境中增强鲁棒性。尽管近期研究将大语言模型(LLM)集成到AVSR中,但其高计算成本阻碍了在资源受限的环境中的部署。为此,我们提出Llama-SMoP(稀疏混合投影器),一种高效的多模态LLM,采用稀疏混合投影器(SMoP)模块以不增加推理成本的方式扩大模型容量。通过融合稀疏门控混合专家(MoE)投影器,Llama-SMoP能够在保持强大性能的同时运用更小的LLM。我们探讨了三种SMoP配置,表明Llama-SMoP DEDR(Disjoint-Experts, Disjoint-Routers,无重叠专家与无重叠路由器)在ASR、VSR和AVSR任务中实现卓越性能。消融研究确认其在专家激活、可扩展性和噪声鲁棒性方面的有效性。

关键词

引用

@article{arxiv.2505.14336,
  title  = {Scaling and Enhancing LLM-based AVSR: A Sparse Mixture of Projectors Approach},
  author = {Umberto Cappellazzo and Minsu Kim and Stavros Petridis and Daniele Falavigna and Alessio Brutti},
  journal= {arXiv preprint arXiv:2505.14336},
  year   = {2025}
}

备注

Interspeech 2025