AHAMask:无需指令的大型音频语言模型可靠任务规约
音频与语音处理
2025-12-02 v3 人工智能
声音
摘要
尽管当前大型音频语言模型(LALMs)通过扩展文本大型语言模型(LLMs)获得了通用声学理解能力,但它们通常存在提示敏感性,即相同意图的不同指令可能产生截然不同的结果。在本工作中,我们提出了 AHAMask,即仅屏蔽 LALMs 的仅解码器 LLM 主干中的部分注意力头,以在无需指令的情况下触发特定声学任务功能。这些掩码通过在一个 LALM 上训练高效获得,其可训练参数量等于其 LLM 主干中的注意力头数。我们通过实验表明,无论是在单一任务还是复合任务上,应用此类选择性注意力头掩码均可获得与使用指令相当甚至更好的性能。除了为 LALMs 实现可靠的声学任务规约外,这也揭示了 LALMs 在其注意力头中表现出特定的“功能通路”。
引用
@article{arxiv.2509.01787,
title = {AHAMask: Reliable Task Specification for Large Audio Language Models without Instructions},
author = {Yiwei Guo and Bohan Li and Hankun Wang and Zhihan Li and Shuai Wang and Xie Chen and Kai Yu},
journal= {arXiv preprint arXiv:2509.01787},
year = {2025}
}
备注
15 pages, 10 tables, 6 figures. This is the camera ready version for AAAI 2026, plus an appendix for supplementary experimental details and results