中文

GIFARC:利用人类直觉类比提升 AI 推理的合成数据集

人工智能 2025-05-28 v1

摘要

抽象与推理语料库(ARC)对通用 AI 能力提出了严格测试,要求求解器仅从少量示例中推断抽象模式。尽管深度学习取得了长足进步,但最先进的模型在 2024 年 ARC 竞赛中的准确率仍仅为 40-55%,表明其性能与人类水平推理之间存在显著差距。本文旨在通过引入一个受类比启发的 ARC 数据集 GIFARC 来弥合这一差距。我们利用大语言模型(LLM)和视觉-语言模型(VLM),从包含类比的各种 GIF 图像中合成新的 ARC 风格任务。每个新任务都配有真实类比,提供了视觉变换与日常概念之间的显式映射。通过将鲁棒的人类直觉类比嵌入 ARC 风格任务,GIFARC 引导 AI 智能体在参与暴力模式搜索之前先进行类比评估,从而有效降低问题复杂度,构建更简洁且人类可理解的解决方案。我们通过实验验证,使用 GIFARC 的类比方法引导 LLM,会影响 LLM 的任务求解方式,使其与人类的类比方法对齐。

关键词

引用

@article{arxiv.2505.20672,
  title  = {GIFARC: Synthetic Dataset for Leveraging Human-Intuitive Analogies to Elevate AI Reasoning},
  author = {Woochang Sim and Hyunseok Ryu and Kyungmin Choi and Sungwon Han and Sundong Kim},
  journal= {arXiv preprint arXiv:2505.20672},
  year   = {2025}
}