中文

是什么让迷宫看起来像迷宫?

计算机视觉与模式识别 2025-02-19 v2 人工智能 计算与语言 机器学习

摘要

人类视觉理解的一个独特之处在于能够灵活解释抽象概念:获取解释其象征意义的抽象规则,将其在熟悉与不熟悉的语境中落地,并对其进行预测或推理。尽管现成的视觉-语言模型擅长对图像进行字面解释(例如识别树枝等物体类别),但它们在理解此类视觉抽象(例如树枝的排列如何构成迷宫的墙壁)方面仍存在困难。为应对这一挑战,我们引入了深度图式落地(DSG),这是一个利用视觉抽象的显式结构化表示进行落地与推理的框架。DSG 的核心是图式——即抽象概念的依赖图描述,将其分解为更原始层级的符号。DSG 使用大语言模型提取图式,然后利用视觉-语言模型将图式中的具体到抽象组件分层落地到图像上。落地后的图式用于增强视觉抽象理解。我们在新的视觉抽象数据集上系统地评估了 DSG 及不同方法的推理能力,该数据集由抽象概念的真实世界图像及人类标注的相应问答对组成。我们表明,DSG 显著提升了视觉-语言模型的抽象视觉推理性能,是迈向与人类对齐的视觉抽象理解的一步。

关键词

引用

@article{arxiv.2409.08202,
  title  = {What Makes a Maze Look Like a Maze?},
  author = {Joy Hsu and Jiayuan Mao and Joshua B. Tenenbaum and Noah D. Goodman and Jiajun Wu},
  journal= {arXiv preprint arXiv:2409.08202},
  year   = {2025}
}

备注

ICLR 2025