ISA-Bench:用于大型音频语言模型指令灵敏度的基准测试
声音
2025-10-28 v1 计算与语言
音频与语音处理
摘要
大型音频语言模型(Large Audio Language Models, LALMs)通过将声学感知与大型语言模型(Large Language Models, LLMs)耦合,从音频中提取和理解多样化信息,已引发学术界和产业界的浓厚兴趣。然而,现有的LALMs对指令措辞高度敏感,这会影响(i)指令遵循率以及(ii)任务性能。然而,目前尚无基准测试能够对这种灵敏度进行系统且全面的评估。我们引入ISA-Bench,这是一个动态基准测试,沿着三个轴向(指令描述、输出格式和任务组成)评估LALMs的指令灵敏度。我们使用ISA-Bench评估了近期的开源和专有LALMs,描绘了在受控指令变体下的合规性和准确性。实验结果表明,即使是最先进的LALMs也存在显著的指令灵敏度,导致其在基本音频理解任务上性能下降。为缓解此问题,我们对Qwen2-Audio进行微调,使用特定构建的复杂指令变体数据集实现了指令遵循性能的显著提升。然而,这也引发了非平凡的灾难性遗忘:模型在面对新的指令样式时会丢失一些先前掌握的任务能力。我们的基准测试为评估和改进LALMs的指令灵敏度提供了标准化的依据,凸显了在实际管道中实现指令鲁棒的音频理解的必要性。
引用
@article{arxiv.2510.23558,
title = {ISA-Bench: Benchmarking Instruction Sensitivity for Large Audio Language Models},
author = {Bohan Li and Wenbin Huang and Yuhang Qiu and Yiwei Guo and Hankun Wang and Zhihan Li and Jing Peng and Ziyang Ma and Xie Chen and Kai Yu},
journal= {arXiv preprint arXiv:2510.23558},
year = {2025}
}
备注
submitted to icassp 2026