视觉语言模型看见你想要的东西,但看不到你看见的东西
人工智能
2025-08-13 v6
摘要
理解他人的意图和站在他人角度观察是人类智能的两个核心组成部分,被视为理论心智(theory-of-mind)的具体化。将此类能力渗透到机器人中是实现人类水平人工智能的重要步骤。为了探讨意图理解和视觉语言模型(VLMs)中的二级视角迁移能力,我们构建了IntentBench和PerspectBench,这两个包含300多个以真实场景和经典认知任务为基础的认知实验。我们发现VLMs在意图理解方面取得了高水平性能,但在二级视角迁移方面表现较差。这表明VLMs在基于模拟的和基于理论的理论心智能力之间可能存在解耦,凸显了它们不具备使用基于模型的推理来推断他人心理状态的能力这一潜在担忧。
引用
@article{arxiv.2410.00324,
title = {Vision Language Models See What You Want but not What You See},
author = {Qingying Gao and Yijiang Li and Haiyun Lyu and Haoran Sun and Dezhi Luo and Hokin Deng},
journal= {arXiv preprint arXiv:2410.00324},
year = {2025}
}
备注
Published at the ICLR 2025 Workshop on Bidirectional Human-AI Alignment (BiAlign)