中文

GENIUS:生成式流体智力评估套件

机器学习 2026-02-12 v1 人工智能 计算机视觉与模式识别

摘要

统一多模态模型(UMMs)在视觉生成方面取得了显著进展。然而,现有基准主要评估基于记忆的智力(Crystallized Intelligence),该方法依赖于回顾已积累的知识和已学习的模式。这忽略了生成式流体智力(GFI):即在即时情境中进行模式诱导、约束推理和适应的能力。为严格评估此能力,我们引入了\textbf{GENIUS}(GEN\textbf{GEN} Fluid I\textbf{I}ntelligence EvalU\textbf{U}ation S\textbf{S}uite)。我们将GFI formalize为三个基本原语的合成。这包括诱导隐式模式(例如推断个性化视觉偏好)、执行临时约束(例如可视化抽象隐喻)以及适应情境知识(例如模拟反直觉物理)。这些原语共同挑战模型在完全基于即时情境的情境中解决问题。我们的系统评估了12个代表性模型,揭示了这些任务上的显著性能缺口。关键的是,我们的诊断分析将这些失败模式分离,表明缺口源于有限的情境理解能力,而非不足的内在生成能力。为弥合这一差距,我们提出了一种无训练注意力干预策略。最终,\textbf{GENIUS}确立了严格的GFI标准,引导领域超越知识利用,朝向动态、通用推理发展。我们的数据集和代码将发布于:\href\href{https://github.com/arctanxarc/GENIUS}{https://github.com/arctanxarc/GENIUS}

关键词

引用

@article{arxiv.2602.11144,
  title  = {GENIUS: Generative Fluid Intelligence Evaluation Suite},
  author = {Ruichuan An and Sihan Yang and Ziyu Guo and Wei Dai and Zijun Shen and Haodong Li and Renrui Zhang and Xinyu Wei and Guopeng Li and Wenshan Wu and Wentao Zhang},
  journal= {arXiv preprint arXiv:2602.11144},
  year   = {2026}
}