音频语言模型是否在聆听?面向自适应音频驾驶的音频专家头部
声音
2026-03-10 v1 人工智能
摘要
多模态大型语言模型可以表现出文本优势,过度依赖语言先验而非以非文本输入为基础进行预测。一个例子是大型音频语言模型(LALM),其中即使包含重要信息的决定性音频证据也可能被低估。为解决此问题,我们使用机制可解释性识别出一小组音频专家注意力头,其音频注意力产生一个 ``聆听'' 信号。我们表明,当音频证据影响模型输出时,该信号会增加,提供了音频参与度的指示器。利用这一局部化,我们构建了一个 audio--silence 驾驶方向,并对最终表示应用推理时激活干预,以放大模型的音频效应。为演示该干预的实用性,我们在 MMAU 上显示,此干预在两个 Qwen-based LALM 上提高了准确率,可提升最高可达 +8.0 个百分点,且无需任何参数更新。
引用
@article{arxiv.2603.06854,
title = {Are Audio-Language Models Listening? Audio-Specialist Heads for Adaptive Audio Steering},
author = {Neta Glazer and Lenny Aharon and Ethan Fetaya},
journal= {arXiv preprint arXiv:2603.06854},
year = {2026}
}