中文

基于多声部查询评估音视频多模态LLM中的幻觉现象:在多样声学条件下

声音 2026-03-20 v2 人工智能 音频与语音处理

摘要

音频视觉多模态模型中的幻觉现象已通过使用探测可靠性的图像文本查询基准进行广泛研究。然而,口语查询对多模态幻觉的影响鲁然未探,尽管语音界面正日益重要。本文引入一套系统化流程,将现有多模态幻觉基准转换为口语查询版本,同时保留原始任务与标签。我们在RePOPE上实现该流程并发布RePOPE-Spk,其中所有查询均以口语音频形式呈现,覆盖多样输入条件。实验结果表明,口语查询下的幻觉现象高于书面查询:干净语音下错误率提升3-6%,在环境噪声下可达30%。此外,许多shot提示和链式思考推理仅能部分缓解幻觉问题。我们的发现催生了构建可靠语音界面系统及评估方法的新方向。

关键词

引用

@article{arxiv.2510.08581,
  title  = {Evaluating Hallucinations in Audio-Visual Multimodal LLMs with Spoken Queries under Diverse Acoustic Conditions},
  author = {Hansol Park and Hoseong Ahn and Junwon Moon and Yejin Lee and Kyuhong Shim},
  journal= {arXiv preprint arXiv:2510.08581},
  year   = {2026}
}

备注

Submitted to Interspeech2026