中文

grounding Before Generalizing: AI 与人类在因果迁移上的差异

人工智能 2026-04-28 v1

摘要

从抽象因果结构中提取概念并将其应用于新情境是人类智能的标志性特征。尽管大型语言模型 (LLM) 和视觉语言模型 (VLM) 在广泛的推理任务中表现出色,但其进行交互式因果学习——通过顺序探索诱导潜在结构并跨情境迁移——的能力仍未得到充分 characterization。人类学习者只需最小程度的暴露即可实现此类迁移,而经典强化学习 (RL) 智能体则会发生灾难性失败。是否意味着当前人工智能 (AI) 模型具备人类类似的抽象因果结构迁移机制 remains 一个开放问题。使用需要顺序发现 Common Cause (CC) 和 Common Effect (CE) 结构的 OpenLock 范式,我们展示了模型表现出根本性的延迟或迁移缺失:即使成功的模型也需要初始环境特定的映射——我们称之为环境 grounding ——在效率提升出现之前,而人类则利用从一开始就可用的先验结构知识。在文本-only 条件下,模型匹配或超过人类的发现效率。相比之下,视觉信息——无论是 image-only 还是 text-and-image 条件——总体上削弱而非增强性能,揭示了模型对符号处理而非整合多模态推理的广泛依赖。模型进一步表现出在人类中不存在的系统性 CC/CE 非对称性,这表明是基于启发式偏差而非方向中性因果抽象。这些发现表明,大规模统计学习并不产生支撑人类类比推理的去情境化因果模式, establishing grounding-dependent transfer as 当前 LLM 和 VLM 的根本性局限。

关键词

引用

@article{arxiv.2604.24062,
  title  = {Grounding Before Generalizing: How AI Differs from Humans in Causal Transfer},
  author = {Liangru Xiang and Yuxi Ma and Zhihao Cao and Yixin Zhu and Song-Chun Zhu},
  journal= {arXiv preprint arXiv:2604.24062},
  year   = {2026}
}