OMHBench:全模态多跳推理的平衡与对齐基准测试
计算与语言
2026-04-29 v3
摘要
多模态大语言模型(MLLMs)已越来越多地支持跨越文本、视觉和语音的全模态处理。然而,此类模型的现有评估框架存在关键局限性,包括模态捷径和有偏的推理路径。为应对这些挑战,我们提出了OMHBench,一个旨在严格评估全模态多跳推理的新型基准。它包含6,144个问题,具有跨越所有三个模态的平衡推理路径和对齐关系。对13种最先进模型的广泛评估揭示了:(1)专有模型与开源MLLM之间存在显著的性能差距,(2)即使专有模型对推理路径变化也表现出高度敏感性,导致全模态对齐的不对称性。值得注意的是,模型在处理语音模态时表现不佳,强调了对全模态智能进行平衡、多跳评估的必要性。
引用
@article{arxiv.2508.16198,
title = {OMHBench: Benchmarking Balanced and Grounded Omni-Modal Multi-Hop Reasoning},
author = {Seunghee Kim and Ingyu Bang and Seokgyu Jang and Changhyeon Kim and Sanghwan Bae and Jihun Choi and Richeng Xuan and Taeuk Kim},
journal= {arXiv preprint arXiv:2508.16198},
year = {2026}
}
备注
ACL 2026 Findings