中文

Vision-EKIPL:面向视觉推理的外部知识注入强化学习框架

计算机视觉与模式识别 2026-05-07 v3

摘要

视觉推理对于理解复杂的多模态数据和推进人工通用智能至关重要。现有方法通过强化学习微调(如 GRPO)来增强多模态大语言模型(MLLMs)的推理能力,但当前的 RL 方法仅从策略模型本身采样动作组,这限制了模型推理能力的上限,导致训练效率低下。为此,本文提出一种新颖的 RL 框架,称为 Vision-EKIPL。该框架的核心在于在 RL 训练过程中引入由外部辅助模型生成的高质量动作,以指导策略模型的优化。通过知识注入实现的策略学习显著扩展了模型的探索空间,有效提升了推理边界,并大幅加快了训练收敛速度和效率。实验结果表明,我们的 Vision-EKIPL 在 Reason-RFT-CoT 基准测试中相较于最先进技术(SOTA)实现了最高 5% 的性能提升。这表明 Vision-EKIPL 能够克服传统 RL 方法的局限性,显著提升 MLLMs 的视觉推理性能,为该领域的研究提供了一种新有效的范式。

关键词

引用

@article{arxiv.2506.06856,
  title  = {Vision-EKIPL: External Knowledge-Infused Policy Learning for Visual Reasoning},
  author = {Chaoyang Wang and Zeyu Zhang and Meng Meng and Xu Zhou and Haiyun Jiang},
  journal= {arXiv preprint arXiv:2506.06856},
  year   = {2026}
}