Jigsaw-R1:基于规则的视觉强化学习与拼图游戏研究
计算机视觉与模式识别
2025-10-14 v3 人工智能
计算与语言
摘要
将基于规则的强化学习 (RL) 应用于多模态大语言模型 (MLLMs) 带来了独特的挑战,并可能偏离纯文本领域的发现,尤其是在感知密集型任务中。本文以拼图游戏作为结构化实验框架,对基于规则的视觉 RL 进行了全面研究。拼图游戏具有固有的真实标签、可调节的难度,且需要复杂的决策,使其成为本研究的理想选择。我们的研究揭示了几个关键发现:首先,我们发现 MLLMs 最初在最简单的拼图游戏上的表现接近随机猜测,但通过微调能够达到近乎完美的准确率,并泛化到复杂的、未见过的配置。其次,在拼图游戏上的训练可以引发向其他视觉任务的泛化,其有效性与特定任务配置相关。第三,MLLMs 无论有无显式推理都能学习并泛化,尽管开源模型通常倾向于直接回答。因此,即使经过逐步推理的训练,它们在推导最终答案时也可能忽略思考过程。第四,我们观察到复杂的推理模式似乎是预先存在的,而非涌现的,其频率随训练和任务难度而增加。最后,我们的结果表明,RL 比 SFT 表现出更有效的泛化能力,且初始的 SFT 冷启动阶段会阻碍后续的 RL 优化。尽管这些观察基于拼图游戏,且在其他视觉任务中可能有所不同,但本研究为理解基于规则的视觉 RL 及其在多模态学习中的潜力这一更大拼图贡献了有价值的一块。代码可在以下地址获取:https://github.com/zifuwanggg/Jigsaw-R1
引用
@article{arxiv.2505.23590,
title = {Jigsaw-R1: A Study of Rule-based Visual Reinforcement Learning with Jigsaw Puzzles},
author = {Zifu Wang and Junyi Zhu and Bo Tang and Zhiyu Li and Feiyu Xiong and Jiaqian Yu and Matthew B. Blaschko},
journal= {arXiv preprint arXiv:2505.23590},
year = {2025}
}
备注
TMLR 2025