中文

基于LLM的抽象视觉推理架构影响分析:RAVEN-FAIR基准测试系统性评估

人工智能 2025-11-18 v1

摘要

本研究旨在系统性地评估大语言模型(LLM)在抽象视觉推理问题中的性能。我们检验了四个LLM模型(GPT-4.1-Mini、Claude-3.5-Haiku、Gemini-1.5-Flash、Llama-3.3-70b)使用四种不同推理架构(单次、嵌入控制重复、自反思、多智能体)在RAVEN-FAIR数据集上的性能。通过三阶段过程(JSON提取、LLM推理、工具函数)生成的视觉响应使用SSIM和LPIPS指标进行评估;分析了Chain-of-Thought得分和错误类型(语义幻觉、数值误认)。结果表明,GPT-4.1-Mini在所有架构下始终取得最高的整体准确率,表明其强大的推理能力。虽然多智能体架构偶尔会改变模型间的语义和数值平衡,但这些影响并非在所有模型中都有益。相反,每种模型对架构设计都表现出不同的灵敏度模式,凸显推理效果仍具有模型特定性。响应覆盖率的差异进一步作为混淆因素,使直接跨架构比较变得复杂。为估计每种配置的上限性能,我们报告了五次独立运行中最佳结果,代表最佳情况而非平均结果。这种多运行策略与最新建议一致,即单次评估脆弱且可能导致不可靠的结论。

关键词

引用

@article{arxiv.2511.11916,
  title  = {An Analysis of Architectural Impact on LLM-based Abstract Visual Reasoning: A Systematic Benchmark on RAVEN-FAIR},
  author = {Sinan Urgun and Seçkin Arı},
  journal= {arXiv preprint arXiv:2511.11916},
  year   = {2025}
}

备注

23 pages, 9 figures