中文

多模态大语言模型的推理局限性——邦加德问题案例研究

人工智能 2025-06-24 v2 计算机视觉与模式识别 机器学习

摘要

抽象视觉推理(AVR)涉及通过类比跨图像发现共享概念,类似于解决IQ测试问题。邦加德问题(BPs)仍是AVR中的关键挑战,需要视觉推理和语言描述。我们研究了多模态大语言模型(MLLMs)是否能解决BPs,通过制定一套多样化的MLLM适配求解策略,并在3个BP数据集上测试了4个专有模型和4个开源模型,这些数据集包含合成(经典BPs)和真实世界(Bongard HOI和Bongard-OpenWorld)图像。尽管在一些真实世界数据集上取得了成功,MLLMs在合成BPs上表现不佳。为探索这一差距,我们引入了Bongard-RWR,一个使用真实世界图像表示合成BP概念的数据集。我们的发现表明,MLLM在经典BPs上的弱表现并非由于领域特异性,而是源于其一般的AVR局限性。代码和数据集可在以下地址获取:https://github.com/pavonism/bongard-rwr

关键词

引用

@article{arxiv.2411.01173,
  title  = {Reasoning Limitations of Multimodal Large Language Models. A Case Study of Bongard Problems},
  author = {Mikołaj Małkiński and Szymon Pawlonka and Jacek Mańdziuk},
  journal= {arXiv preprint arXiv:2411.01173},
  year   = {2025}
}

备注

Accepted to The Forty-Second International Conference on Machine Learning (ICML 2025)