基于大语言模型的专家产品:提升ARC表现是视角问题
计算与语言
2025-06-12 v2 人工智能
机器学习
摘要
抽象与推理语料库(ARC-AGI)是大语言模型(LLM)的重大挑战,暴露了其抽象推理能力的局限性。本工作利用任务特定数据增强在训练、生成和评分阶段,并采用深度优先搜索算法生成多样且高概率的候选解答。此外,我们将LLM不仅用作生成器,也用作评分器,利用其输出概率选择最有前景的解答。我们的方法在公共ARC-AGI评估集上实现了71.6%的得分(共解答286.5/400个任务),在公开可获得的方法中实现了最先进的性能。虽然同时发布的封闭式工作报告了更高的得分,但我们的方法在透明性、可复现性和极低的推理成本方面具有显著优势,平均仅需约2分人民币/个任务即可在 readily available 硬件上完成(我们假设NVIDIA 4090 GPU的价格为36分人民币/小时)。
引用
@article{arxiv.2505.07859,
title = {Product of Experts with LLMs: Boosting Performance on ARC Is a Matter of Perspective},
author = {Daniel Franzen and Jan Disselhoff and David Hartmann},
journal= {arXiv preprint arXiv:2505.07859},
year = {2025}
}
备注
ICML 2025 camera-ready; 15 pages, 6 figures, 5 tables