基于多模态项目反应理论评估跨模态推理能力与问题特征
计算与语言
2026-03-04 v1 计算机视觉与模式识别
摘要
多模态大语言模型(MLLMs)最近涌现出能够对多样模态进行推理的通用架构。对于 MLLMs 的基准测试应衡量其跨模态集成能力。然而,当前的基准测试中充斥着捷径问题,这些问题仅使用单一模态即可求解,从而导致排名不可靠。例如,在视觉-语言情境中,我们可以在没有图像或文本的情况下找到正确答案。这类低质量问题不必要地增加了基准测试的规模和计算需求。我们引入一种多模态多维项目反应理论框架(M3IRT),该框架通过分解模型能力和项目难度中的图像-only、文本-only 和跨模态组件来扩展经典 IRT。M3IRT 估计 MLLMs 的跨模态能力以及每个问题的跨模态难度,实现紧凑、高质量的子集,更能反映多模态推理。在 24 个 VLMs 上进行三个基准测试中,M3IRT 优先选择真正的跨模态问题而非捷径问题,并即使人工生成 50% 的低质量问题,仍能保持排名保真度,从而在提高可靠性的同时降低评估成本。M3IRT 因此为评估跨模态推理和细化多模态基准提供了实用工具。
引用
@article{arxiv.2603.02663,
title = {Evaluating Cross-Modal Reasoning Ability and Problem Characteristics with Multimodal Item Response Theory},
author = {Shunki Uebayashi and Kento Masui and Kyohei Atarashi and Han Bao and Hisashi Kashima and Naoto Inoue and Mayu Otani and Koh Takeuchi},
journal= {arXiv preprint arXiv:2603.02663},
year = {2026}
}
备注
24pages, 20 figures, accepted to ICLR2026