中文

面向可验证推理的多模态事实层级归因

计算与语言 2026-05-08 v2 人工智能 计算机视觉与模式识别

摘要

多模态大语言模型 (MLLM) 越来越多地用于涉及多步推理和长形式生成的实际任务,其中可靠性需要将模型输出 grounding 在异构输入来源上并验证每个事实性声明。然而,现有的多模态 grounding 基准和评估方法聚焦于简化的、基于观察的场景或有限模态,无法评估复杂多模态推理中的归因。我们引入 MuRGAt (Multimodal Reasoning with Grounded Attribution),用于评估需要超越直接观察的情境下的事实层级多模态归因。给定涵盖视频、音频及其他模态的输入,MuRGAt 需要模型生成带有显式推理和精确引用的答案,其中每个引用指定模态和时间段。为实现可靠评估,我们引入自动评估框架,强烈与人类判断相吻合。基准测试中人类和自动评分的结果表明,即使是强大的 MLLM 也经常在正确推理后产生幻觉式引用。此外,我们观察到关键权衡:增加推理深度或强制结构化 grounding 往往会降低准确率,这凸显了内部推理与可验证归因之间的显著差距。

关键词

引用

@article{arxiv.2602.11509,
  title  = {Multimodal Fact-Level Attribution for Verifiable Reasoning},
  author = {David Wan and Han Wang and Ziyang Wang and Elias Stengel-Eskin and Hyunji Lee and Mohit Bansal},
  journal= {arXiv preprint arXiv:2602.11509},
  year   = {2026}
}

备注

Accepted to ICML 2026. Code and data are available at https://github.com/meetdavidwan/murgat