中文

基于 Matryoshka 的多模态 LLM 用于自适应音视语音识别

计算机视觉与模式识别 2025-08-07 v2 多媒体 声音 音频与语音处理

摘要

音视语音识别(AVSR)利用音频和视觉两种模态在嘈杂环境中提升识别鲁棒性。近期大型语言模型(LLM)在语音识别方面表现突出,包括 AVSR。然而,长时间的语音表征会导致 LLM 的高计算成本。先前方法在将输入送入 LLM 前进行压缩,但高压缩率常损害准确率。为此,我们提出了 Llama-MTSK,这是首个基于 Matryoshka 的多模态 LLM 用于 AVSR,能够在不同计算资源限制下灵活调整音视 token 的分配。受 Matryoshka 表示学习启发,我们的模型采用单一架构在多个层级上编码表征,无需额外模型。为实现高效微调,我们引入三种基于 LoRA 的策略,使用全局和尺度特定模块。在主要 AVSR 数据集上的评估表明,Llama-MTSK 在匹配或超越固定压缩水平训练的模型方面表现良好。

关键词

引用

@article{arxiv.2503.06362,
  title  = {Adaptive Audio-Visual Speech Recognition via Matryoshka-Based Multimodal LLMs},
  author = {Umberto Cappellazzo and Minsu Kim and Stavros Petridis},
  journal= {arXiv preprint arXiv:2503.06362},
  year   = {2025}
}

备注

Accepted to IEEE ASRU 2025