中文

Point-RFT:通过视觉基础强化微调提升多模态推理

计算机视觉与模式识别 2025-05-27 v1

摘要

大型语言模型的最新进展通过有效利用思维链(CoT)和强化学习,显著提升了文本推理能力。然而,由于纯文本 CoT 的固有局限性(如视觉幻觉和多模态整合不足),将这些成功扩展到视觉语言任务仍具挑战性。在本文中,我们介绍了 Point-RFT,这是一个明确设计为利用视觉基础 CoT 推理进行视觉文档理解的多模态推理框架。我们的方法包含两个阶段:首先,我们使用一个包含 71K 多样化视觉推理问题的精选数据集进行格式微调,每个问题都附有详细、明确的逐步推理依据,并与相应的视觉元素相基础对应。其次,我们采用针对视觉文档理解的强化微调。在 ChartQA 上,我们的方法将准确率从 70.88%(格式微调基线)提升至 90.04%,超越了仅依赖基于文本的 CoT 的强化微调所达到的 83.92% 准确率。结果表明,与纯文本 CoT 相比,我们的基础 CoT 对多模态推理更为有效。此外,Point-RFT 在多个领域外视觉文档推理基准(包括 CharXiv、PlotQA、IconQA、TabMWP 等)上展现出卓越的泛化能力,突显了其在复杂现实场景中的潜力。

关键词

引用

@article{arxiv.2505.19702,
  title  = {Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning},
  author = {Minheng Ni and Zhengyuan Yang and Linjie Li and Chung-Ching Lin and Kevin Lin and Wangmeng Zuo and Lijuan Wang},
  journal= {arXiv preprint arXiv:2505.19702},
  year   = {2025}
}