CALM:大型音频语言模型的类别条件稀疏注意力向量
声音
2026-03-24 v2 人工智能
摘要
大型音频语言模型(LALM)在多个下游任务中表现出强大的零样本能力,如音频问答和抽象推理;然而,这些模型在某些判别性任务(例如音频分类)方面仍落后于专业模型。最近的研究表明,LALM中稀疏注意力头的子集可作为下游任务(如分类)通过简单投票方案的强判别特征提取器。然而,这些方法对所选注意力头赋予统一权重,隐含地假设每个注意力头在所有语义类别中贡献相等。在本工作中,我们提出了一种用于大型音频语言模型的类别条件稀疏注意力向量(CALM),这是一种few-shot分类方法,通过学习注意力头的类别依赖重要性权重来实现。该表述允许个别注意力头在不同语义类别中专门化,并按其估计可靠性比例贡献于集成预测。在多个few-shot音频和音视频分类基准和任务上进行的实验表明,我们的方法在音频分类、音视频分类和欺骗检测等方面分别比最先进的统一投票方法高出最高可达14.52%、1.53%、8.35%的绝对提升。
关键词
引用
@article{arxiv.2602.07077,
title = {CALM: Class-Conditional Sparse Attention Vectors for Large Audio-Language Models},
author = {Videet Mehta and Liming Wang and Hilde Kuehne and Rogerio Feris and James R. Glass and M. Jehanzeb Mirza},
journal= {arXiv preprint arXiv:2602.07077},
year = {2026}
}
备注
11 pages, 6 figures