中文

BRIDGE:基于 grounding 证据的长多模态文档多跳推理基准

计算与语言 2026-03-10 v1

摘要

多跳问答 (QA) 广泛用于评估大型语言模型的推理能力,但大多数基准关注最终答案的正确性,忽略了尤其在长多模态文档中的中间推理。我们引入BRIDGE,一个针对需要整合文本、表格和图表证据的长科学论文进行多跳推理的基准。数据集支持链式和分支结构,提供显式的多跳推理注释,用于超越答案准确性的步骤级评估。使用最先进的LLM和多模态检索增强生成 (RAG) 系统的实验揭示了在常规仅答案评估中隐藏的证据聚合和 grounding 能力不足。BRIDGE为诊断长多模态文档中的推理故障提供了针对性测试场。

关键词

引用

@article{arxiv.2603.07931,
  title  = {BRIDGE: Benchmark for multi-hop Reasoning In long multimodal Documents with Grounded Evidence},
  author = {Biao Xiang and Soyeon Caren Han and Yihao Ding},
  journal= {arXiv preprint arXiv:2603.07931},
  year   = {2026}
}