中文

超越笛卡尔错觉:在感知瓶颈下测试两阶段多模态心智理论

人工智能 2026-05-19 v1 计算机视觉与模式识别

摘要

尽管多模态大语言模型在一般推理中展现出令人瞩目的能力,但其具身空间智能仍受制于“笛卡尔错觉”——即依赖缺乏物理基础的三维拓扑理解的基于文本的概率分布。这一局限性在多智能体环境中暴露无遗,因为该环境不仅需要场景感知,还需要二阶心智理论。具体而言,智能体 A 必须能够推断智能体 B 对环境的信念,且该信念严格受限于智能体 B 的物理朝向与感官限制。在本文中,我们通过一项新颖的视听任务探究了 MLLMs 中两阶段空间推理的极限:要求智能体 A 预测智能体 B 对 A 相对位置的估计。为解决此问题,我们提出了一种认知感官瓶颈模块,摒弃了僵化的基于规则的坐标变换。相反,我们引入了基于锚点的具身空间分解思维链。这引导 MLLM 进行“几何到语义”的投影,迫使其首先建立 B 的局部坐标系,然后根据 A 是否落入 B 的视锥内动态加权视觉和听觉模态。广泛评估表明,尽管当前的 MLLMs 在空间对称性与视野外歧义方面存在根本性困难(建立了 42% 准确率的严格零样本基线),我们的感官受限推理链稳健地优于纯自我中心与他者中心基线。通过系统地对这些感知瓶颈进行基准测试,我们的工作揭示了 MLLM 空间推理的当前局限,并为具身智能中的认知性、模态感知推理确立了基础范式。

关键词

引用

@article{arxiv.2605.18194,
  title  = {Beyond the Cartesian Illusion: Testing Two-Stage Multi-Modal Theory of Mind under Perceptual Bottlenecks},
  author = {Yajing Zhou and Xiangyu Kong},
  journal= {arXiv preprint arXiv:2605.18194},
  year   = {2026}
}

备注

17 pages, 3 figures