中文

OMHBench:全模态多跳推理的平衡与对齐基准测试

计算与语言 2026-04-29 v3

摘要

多模态大语言模型(MLLMs)已越来越多地支持跨越文本、视觉和语音的全模态处理。然而,此类模型的现有评估框架存在关键局限性,包括模态捷径和有偏的推理路径。为应对这些挑战,我们提出了OMHBench,一个旨在严格评估全模态多跳推理的新型基准。它包含6,144个问题,具有跨越所有三个模态的平衡推理路径和对齐关系。对13种最先进模型的广泛评估揭示了:(1)专有模型与开源MLLM之间存在显著的性能差距,(2)即使专有模型对推理路径变化也表现出高度敏感性,导致全模态对齐的不对称性。值得注意的是,模型在处理语音模态时表现不佳,强调了对全模态智能进行平衡、多跳评估的必要性。

关键词

引用

@article{arxiv.2508.16198,
  title  = {OMHBench: Benchmarking Balanced and Grounded Omni-Modal Multi-Hop Reasoning},
  author = {Seunghee Kim and Ingyu Bang and Seokgyu Jang and Changhyeon Kim and Sanghwan Bae and Jihun Choi and Richeng Xuan and Taeuk Kim},
  journal= {arXiv preprint arXiv:2508.16198},
  year   = {2026}
}

备注

ACL 2026 Findings