中文

音频幻觉攻击:探讨大型音频语言模型的可靠性

声音 2026-04-01 v1

摘要

大型音频语言模型(Large Audio Language Models, LALMs)在音频语言任务中取得了卓越的性能;然而,它们在实际场景下的可靠性仍未得到充分探讨。我们引入音频幻觉攻击(Audio Hallucination Attacks, AHA),一个名为 AHA-Eval 的攻击套件,包含 6500 份问答对,用于测试 LALMs 是否真正依据音频输入来生成响应。AHA 针对两类攻击面:(i)查询式攻击,利用问题结构诱导关于不存在声音的幻觉;(ii)音频式攻击,将描述不存在事件的合成语音注入音频流。评估包括 Audio Flamingo 3 和 Gemini 3 Pro 等最先进的 LALMs,我们观察到分别为 95.35% 和 79.65% 的高攻击成功率,揭示了被标准基准性能掩盖的可靠性差距。为缓解此问题,我们提出包含 12 万份问答对的事后对齐数据集 AHA-Guard,成功将攻击成功率降低至最高 49%。

关键词

引用

@article{arxiv.2603.29263,
  title  = {Audio Hallucination Attacks: Probing the Reliability of Large Audio Language Models},
  author = {Ashish Seth and Sonal Kumar and Ramaneswaran Selvakumar and Nishit Anand and Utkarsh Tyagi and Prem Seetharaman and Ramani Duraiswami and Dinesh Manocha},
  journal= {arXiv preprint arXiv:2603.29263},
  year   = {2026}
}