中文

MEDVISTAGYM:用于通过工具集成强化学习进行医学图像思考的可扩展训练环境

计算机视觉与模式识别 2026-01-13 v1 人工智能

摘要

视觉语言模型(VLM)在通用图像理解方面取得了强大的性能,但在进行通过迭代视觉交互进行多步推理时,仍然难以处理医学图像。医学 VLM 通常依赖于静态视觉嵌入和单次推理,阻碍了模型在推理过程中重新检查、验证或细化视觉证据。虽然工具集成推理提供了一条有前景的道路,但开源 VLM 缺乏学习有效工具选择、调用和在多模态医学推理中协调的训练基础设施。我们引入了 MedVistaGym,一个可扩展且互动的训练环境,激励医学图像分析中工具集成的视觉推理。MedVistaGym 使 VLM 能够确定何时以及调用哪些工具、局部化任务相关的图像区域,并将单一或多个子图像证据整合到统一、可执行的接口中进行交错多模态推理。通过 MedVistaGym,我们训练了 MedVistaGym-R1,通过轨迹采样和端到端强化学习,将工具使用与智能体推理交错进行。在六个医学 VQA 基准测试中,MedVistaGym-R1-8B 相对于相当大小的工具增强基线提高了 19.10%至 24.21%,表明结构化的智能体训练——而不仅仅是工具访问——为医学图像分析中的工具集成推理提供了有效的解决方案。

关键词

引用

@article{arxiv.2601.07107,
  title  = {MEDVISTAGYM: A Scalable Training Environment for Thinking with Medical Images via Tool-Integrated Reinforcement Learning},
  author = {Meng Lu and Yuxing Lu and Yuchen Zhuang and Megan Mullins and Yang Xie and Guanghua Xiao and Charles Fleming and Wenqi Shi and Xuan Wang},
  journal= {arXiv preprint arXiv:2601.07107},
  year   = {2026}
}