音频大语言模型中多事件音频 grounding 的灵敏度分析
声音
2026-03-05 v1
摘要
音频大语言模型已展现出强大的音频样本理解能力,但在复杂声学场景中的可靠性仍未得到充分探索。不同于以往仅限于小规模或控制较弱的查询构建的工作,我们提出了对事件 grounding 与误报进行大规模评估,以声学场景复杂度为变量。使用 71K AudioCapsV2 剪辑,我们提取归一化 (source, attribute) 事件,并构建两种查询类型:用于 ground-truth 检测的 present-event 查询,以及用于探测幻觉的 absent-event 查询,采用基于音频对齐文本嵌入空间中的相似度过滤进行负采样。我们对四个 SOTA 音频 LLM 进行评估,每个模型测试 12 种 prompt 变体,共计 50 万个 yes/no 查询。 在所有模型中,随着事件数量的增加,true-positive rate 持续下降,false-positive rate 持续上升,而 prompt 变体导致二者之间出现强烈的权衡。我们的置信度分析显示,模型在多事件音频上变得更不确定,这表明仍有提升的空间。
引用
@article{arxiv.2603.03855,
title = {A Sensitivity Analysis of Multi-Event Audio Grounding in Audio LLMs},
author = {Taehan Lee and Jaehan Jung and Hyukjun Lee},
journal= {arXiv preprint arXiv:2603.03855},
year = {2026}
}
备注
6 pages, Submitted to Interspeech 2026