中文

Wiki-R1:通过数据和抽样课程激励基于知识的多模态 VQA 推理

计算机视觉与模式识别 2026-03-06 v1

摘要

知识型视觉问答(KB-VQA)需要模型通过整合外部知识来回答关于图像的问题,这带来了显著挑战,由于检索结果噪声且知识库具有结构化、百科性质,导致与预训练多模态大语言模型(MLLM)之间存在分布格局差异,使有效推理和后期微调在实际应用中困难。本文提出 \textit{Wiki-R1},一种基于数据生成的课程强化学习框架,系统性地激励 MLLM 在 KB-VQA 中的推理。Wiki-R1 构建一系列与模型演进能力相匹配的训练分布,弥合从预训练到 KB-VQA 目标分布之间的差距。我们引入可控课程数据生成,扰动检索器以产生所需难度水平的样本,以及课程抽样策略,筛选在 RL 更新中可能产生非零优势的样本。样本难度通过观察奖励估计,并传播至未观察的样本以指导学习。在两个 KB-VQA 数据集上进行实验,Encyclopedic VQA 和 InfoSeek,Wiki-R1 实现了新的最佳结果,将 Encyclopedic VQA 的准确率从 35.5% 提升至 37.1%,将 InfoSeek 的准确率从 40.1% 提升至 44.1%。项目页面可访问于 https://artanic30.github.io/project_pages/WikiR1/。

关键词

引用

@article{arxiv.2603.05256,
  title  = {Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum},
  author = {Shan Ning and Longtian Qiu and Xuming He},
  journal= {arXiv preprint arXiv:2603.05256},
  year   = {2026}
}

备注

Accepted by ICLR 26, code and weights are publicly available