基于 R1 类推理大型视觉语言模型的 SFT 或 RL 研究
计算机视觉与模式识别
2025-12-25 v3 图像与视频处理
摘要
本工作重新审视了训练大型视觉语言模型 (LVLMs) 的主导监督微调 (SFT) 然后强化学习 (RL) 范式,发现一个关键发现:SFT 会显著损害随后的 RL,通过诱导“伪推理路径”来模仿专家模型。虽然这些路径可能类似于 RL 模型的本机推理路径,但它们通常涉及延长、犹豫、信息不足且错误的推理步骤。为系统性地研究这一效应,我们引入了 VLAA-Thinking,一个新的多模态数据集,旨在支持 LVLMs 的推理。通过包括描述、推理蒸馏、答案重写和验证的六步管道构建,VLAA-Thinking 包含用于 SFT 的高质量、逐步视觉推理痕迹,以及来自同一数据源的更具挑战性的 RL 分割。使用这个数据集,我们进行了大量实验,比较了 SFT、RL 和它们的组合。结果表明,尽管 SFT 有助于模型学习推理格式,但它通常会将对齐的模型锁定在模仿性、僵化的推理模式中,这会阻碍进一步学习。相比之下,基于 Group Relative Policy Optimization (GRPO) 的 RL 方法,结合了新的混合奖励模块集成感知和认知信号,促进了更真实、更自适应的推理行为。值得注意的是,我们的模型 VLAA-Thinker 基于 Qwen2.5VL 3B,在 Open LMM Reasoning Leaderboard 上以 4B 规模的 LVLMs 中取得了最高的 top-1 性能,超越了前一水平方法 1.8%。我们希望我们的发现为开发具推理能力的 LVLMs 提供有价值的见解,并能为该领域的未来研究提供指导。
引用
@article{arxiv.2504.11467,
title = {A Multicore and Edge TPU-Accelerated Multimodal TinyML System for Livestock Behavior Recognition},
author = {Qianxue Zhang and Eiman Kanjo},
journal= {arXiv preprint arXiv:2504.11467},
year = {2025}
}
备注
12 pages, 10 figures