中文

以更少样本达到 SoTA:用于数据高效视觉推理自我改进的 MCTS 引导样本选择

计算机视觉与模式识别 2025-06-02 v3

摘要

我们引入了 ThinkLite-VL,一系列视觉推理模型,它们仅使用少一个数量级的训练样本即可达到最先进的性能,且纯粹依赖强化微调自我改进,无需任何知识蒸馏。我们的核心洞察是,样本难度对 RFT 的有效性具有关键影响:适度具有挑战性的样本能够驱动显著的推理能力提升,即使在低数据量条件下也是如此。然而,以可靠且可扩展的方式量化样本难度并非易事。为了解决这一问题,我们重新利用蒙特卡洛树搜索来衡量样本难度,即通过视觉语言模型解决每个实例所需的推理迭代次数。这种基于 MCTS 的选择程序能够识别出可诱导更深层次推理但仍可求解的样本,使我们能够从涵盖数学、自然图像理解和图表理解的 7 万个开源样本中筛选出高质量子集。使用该方法,我们仅为 Qwen2.5-VL-7B-Instruct 选择了 1.1 万个挑战性样本进行 RFT,为 Qwen2.5-VL-72B-Instruct 选择了 7500 个样本。由此产生的模型 ThinkLite-VL-7B 和 ThinkLite-VL-72B 在八个视觉推理基准测试中均显著优于其各自的基础模型。特别是,ThinkLite-VL-7B 将 Qwen2.5-VL-7B-Instruct 的平均性能提升了 7%,并超越了所有现有的 7B 级别模型以及 GPT-4o、O1 和 Qwen2.5-VL-72B 等更大规模的模型,在 MathVista 上取得了 75.1 的新 SoTA 分数。ThinkLite-VL-72B 进一步推进了 SoTA 前沿,在 MathVista 上达到了 79.7 的准确率,并且相较于开源 SoTA 实现了 4.42 的平均基准提升。这些结果表明,MCTS 引导的难度过滤为多模态推理中数据高效的自我改进提供了一条可扩展且有效的路径。

关键词

引用

@article{arxiv.2504.07934,
  title  = {SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement},
  author = {Xiyao Wang and Zhengyuan Yang and Chao Feng and Hongjin Lu and Linjie Li and Chung-Ching Lin and Kevin Lin and Furong Huang and Lijuan Wang},
  journal= {arXiv preprint arXiv:2504.07934},
  year   = {2025}
}

备注

27 pages, 5 figures