中文

强化视觉语言模型以在资源受限条件下使用工具进行详细视觉推理

机器学习 2025-08-06 v3 人工智能 计算机视觉与模式识别

摘要

尽管近期在大模型推理能力方面取得了巨大进展,但视觉语言模型(VLMs)在资源受限时仍难以进行详细的视觉推理。为此,我们借鉴了 Deepseek-r1 等方法,训练规模较小的模型以使用诸如缩放等外部工具。组Relative Policy Optimization(GRPO)的组合应用能获得最大收益,包括 GRPO 学习、简单奖励结构、简化工具调用界面、为工具调用结果分配额外标记,以及过度代表视觉困难示例的训练数据混合。与规模相似的基线模型相比,我们的方法在某些视觉问答(VQA)任务上取得了更好表现,得益于从外部工具获取的详细视觉信息。

关键词

引用

@article{arxiv.2506.14821,
  title  = {Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints},
  author = {Sunil Kumar and Bowen Zhao and Leo Dirac and Paulina Varshavskaya},
  journal= {arXiv preprint arXiv:2506.14821},
  year   = {2025}
}