CARV:多模态大语言模型中组合类比推理的诊断基准
人工智能
2026-03-31 v1
摘要
类比推理检验了人类认知的基本方面:将一个对象对之间的关系映射到另一个对象对。现有评估方式忽视了从多个来源组合规则的能力,这是高阶智能的关键组成部分。为填补这一空白,我们引入 CARV(Compositional Analogical Reasoning in Vision),构建一个包含 5,500 样本的新型任务与数据集,作为首个此类诊断基准。我们将类比从单一对象对扩展至多个对象对,这要求 MLLMs 从每个对象对提取符号规则并组合新的变换。对当前主流 MLLMs 进行评估,发现性能差距显著:即便是 Gemini-2.5 Pro 仅达到 40.4% 的准确率,远低于人类水平的 100%。诊断分析显示,两种一致的失败模式:(1)将视觉变化分解为符号规则;(2)在多样或复杂情境下保持鲁棒性,这凸显了当前 MLLMs 在此任务上的局限性。
引用
@article{arxiv.2603.27958,
title = {CARV: A Diagnostic Benchmark for Compositional Analogical Reasoning in Multimodal LLMs},
author = {Yongkang Du and Xiaohan Zou and Minhao Cheng and Lu Lin},
journal= {arXiv preprint arXiv:2603.27958},
year = {2026}
}