LlamaV-o1:重新思考LLM中的逐步视觉推理
高能天体物理现象
2025-01-28 v2
摘要
推理是解决复杂多步骤问题的基本能力,尤其在视觉情境中需要逐步理解。现有方法缺乏针对视觉推理的综合评估框架,且不强调逐步问题解决。为此,我们提出了一套系统化框架,通过三个关键措施推进大型语言模型中的逐步视觉推理:首先,引入针对评估多步骤推理任务的视觉推理基准测试。该基准包含多样化挑战,涵盖八个不同类别,从复杂视觉感知到科学推理,总计超过4000个推理步骤,实现对LLMs进行精准、可解释的跨步骤视觉推理评估。其次,我们提出一种新型指标,以步骤粒度评估视觉推理质量,强调正确性与逻辑一致性。该指标相较于传统端到任务准确率指标提供更深入的性能洞察。最后,我们构建了一个新的多模态视觉推理模型,命名为LlamaV-o1,采用分步课程学习训练,按序排列任务以促进技能的逐步掌握与问题解决。LlamaV-o1专为多步骤推理设计,通过结构化训练范式实现逐步学习。大量实验表明,LlamaV-o1在现有开源模型中显著领先,与闭源专有模型相比也表现优异。相较于近期的Llava-CoT,LlamaV-o1在六个基准测试中平均得分提升3.8个百分点,同时推理加速5倍。我们的基准、模型和代码已公开。
引用
@article{arxiv.2501.06185,
title = {QPEs as Lense-Thirring precession of super-Eddington flows},
author = {M. Middleton and A. Gurpide and T. M. Kwan and L. Dai and R. Arcodia and J. Chakraborty and T. Dauser and P. C. Fragile and A. Ingram and G. Miniutti and C. Pinto and P. Kosec},
journal= {arXiv preprint arXiv:2501.06185},
year = {2025}
}
备注
15 pages, 9 figures, accepted for publication in MNRAS