Skywork-R1V4:通过图像与 DeepResearch 交错思考实现智能多模态
计算机视觉与模式识别
2025-12-09 v2
摘要
尽管近期在多模态智能系统方面取得了进展,但现有方法常将图像操作和网络搜索视为互不相干的能力,依赖高昂的强化学习,且缺乏基于真实工具执行痕迹的规划。为此,我们提出了 Skywork-R1V4,一个 30B (A3B) 参数的多模态智能模型,统一了多模态规划、主动图像操作(''以图像思考'')、深度多模态搜索,最关键的是实现在视觉操作和外部知识检索之间动态交错的推理。Skywork-R1V4 仅通过在不到 30,000 条高质量、规划-执行一致轨迹上的监督微调训练,经过逐步一致性筛选验证,在感知和多模态搜索基准测试中实现了最先进的结果:它在 MMSearch 上得分 66.1,在 FVQA 上得分 67.2,超越了 Gemini 2.5 Flash 在所有 11 项指标上。Skywork-R1V4 在推理时展现出涌现的长程推理能力,成功地协调了超过 10 次工具调用以解决复杂的多步骤任务。我们的结果表明,通过精心策划的监督学习即可实现 sophisticated 的智能多模态,无需任何强化学习依赖。
引用
@article{arxiv.2512.02395,
title = {Skywork-R1V4: Toward Agentic Multimodal Intelligence through Interleaved Thinking with Images and DeepResearch},
author = {Yifan Zhang and Liang Hu and Haofeng Sun and Peiyu Wang and Yichen Wei and Shukang Yin and Jiangbo Pei and Wei Shen and Peng Xia and Yi Peng and Tianyidan Xie and Eric Li and Yang Liu and Xuchen Song and Yahui Zhou},
journal= {arXiv preprint arXiv:2512.02395},
year = {2025}
}
备注
21 pages, 7 figures