中文

探测大型视觉语言模型中的机械推理能力

人工智能 2025-08-14 v4 神经元与认知

摘要

机械推理是人类智慧的标志,其在日常任务到土木工程等领域均扮演着不可替代的角色。因此,将机械推理嵌入机器系统,是实现人类水平人工智能的重要步骤。本文利用 155 个认知实验测试了 26 个视觉语言模型 (VLMs) 对于系统稳定性、齿轮和滑轮系统、杠杆原理、惯性与运动以及流体力学理解的能力。结果表明,VLMs 在所有领域都表现得比人类差,而在齿轮系统和流体力学推理方面表现出显著困难。值得注意的是,随着参数数量的增加,这些任务的表现并未得到改善,这表明当前基于注意力的架构可能无法把握机械推理中所需的某些底层机制,尤其是涉及心理模拟的机制。

关键词

引用

@article{arxiv.2410.00318,
  title  = {Probing Mechanical Reasoning in Large Vision Language Models},
  author = {Haoran Sun and Qingying Gao and Haiyun Lyu and Dezhi Luo and Yijiang Li and Hokin Deng},
  journal= {arXiv preprint arXiv:2410.00318},
  year   = {2025}
}

备注

Published at the ICLR 2025 Workshop on Bidirectional Human-AI Alignment (BiAlign)