中文

探究大型音频语言模型的忠实性

机器学习 2026-03-20 v3 音频与语音处理

摘要

大型音频语言模型 (LALM) 将音频编码器与预训练的大型语言模型集成,以执行复杂的多模态推理任务。虽然这些模型可以生成思维链 (CoT) 解释,但这些推理链的忠实性仍不清楚。在本工作中,我们提出了一个系统框架,以评估 LALM 中 CoT 相对于输入音频和最终模型预测的忠实性。我们定义了音频忠实性的三个标准:无幻觉、整体性和专注倾听。我们还引入了一个基于音频和 CoT 干预的基准来评估忠实性。在 Audio Flamingo 3 和 Qwen2.5-Omni 上的实验表明存在潜在的多模态脱节:推理通常与最终预测一致,但并不总是牢固地基于音频,并且可能容易受到幻觉或对抗性扰动的影响。

关键词

引用

@article{arxiv.2509.22363,
  title  = {Investigating Faithfulness in Large Audio Language Models},
  author = {Pooneh Mousavi and Lovenya Jain and Mirco Ravanelli and Cem Subakan},
  journal= {arXiv preprint arXiv:2509.22363},
  year   = {2026}
}