基于 Matryoshka 的多模态 LLM 用于自适应音视语音识别
计算机视觉与模式识别
2025-08-07 v2 多媒体
声音
音频与语音处理
摘要
音视语音识别(AVSR)利用音频和视觉两种模态在嘈杂环境中提升识别鲁棒性。近期大型语言模型(LLM)在语音识别方面表现突出,包括 AVSR。然而,长时间的语音表征会导致 LLM 的高计算成本。先前方法在将输入送入 LLM 前进行压缩,但高压缩率常损害准确率。为此,我们提出了 Llama-MTSK,这是首个基于 Matryoshka 的多模态 LLM 用于 AVSR,能够在不同计算资源限制下灵活调整音视 token 的分配。受 Matryoshka 表示学习启发,我们的模型采用单一架构在多个层级上编码表征,无需额外模型。为实现高效微调,我们引入三种基于 LoRA 的策略,使用全局和尺度特定模块。在主要 AVSR 数据集上的评估表明,Llama-MTSK 在匹配或超越固定压缩水平训练的模型方面表现良好。
引用
@article{arxiv.2503.06362,
title = {Adaptive Audio-Visual Speech Recognition via Matryoshka-Based Multimodal LLMs},
author = {Umberto Cappellazzo and Minsu Kim and Stavros Petridis},
journal= {arXiv preprint arXiv:2503.06362},
year = {2025}
}
备注
Accepted to IEEE ASRU 2025