中文

Surgery-R1:通过强化学习实现推理多模态大语言模型以提升手术 VQLA

计算机视觉与模式识别 2025-06-25 v1 人工智能

摘要

近年来,手术场景理解领域取得了显著进展,尤其是在机器人手术中的视觉问答定位回答(Surgical-VQLA)任务上。然而,现有的 Surgical-VQLA 模型缺乏深层推理能力和可解释性,这限制了其在临床应用中的可靠性和发展潜力。为此,启发于推理多模态大语言模型(Reasoning Multimodal Large Language Models, MLLMs)的发展,我们首先构建了包含 54k 条数据的 Surgery-R1 数据集,涵盖视觉-QA、定位-QA 和链式思维(Chain-of-Thought, CoT)的配对数据。随后,我们提出了首个用于 Surgical-VQLA 的推理 MLLM(Surgery-R1)。在 Surgery-R1 中,我们设计了两阶段微调机制,通过利用监督微调(SFT)和强化微调(RFT)使基础 MLLM 具备复杂推理能力。此外,为在 RFT 中构建高效且高质量基于规则的奖励系统,我们设计了多模态一致性奖励机制,以缓解手术场景中可能出现的定位幻觉。实验结果表明,Surgery-R1 在 Surgical-VQLA 任务中超越了其他现有最先进(SOTA)模型和广泛使用的 MLLM,同时验证了其推理能力和方法有效性。代码和数据集将发布于 https://github.com/FiFi-HAO467/Surgery-R1。

关键词

引用

@article{arxiv.2506.19469,
  title  = {Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning},
  author = {Pengfei Hao and Shuaibo Li and Hongqiu Wang and Zhizhuo Kou and Junhang Zhang and Guang Yang and Lei Zhu},
  journal= {arXiv preprint arXiv:2506.19469},
  year   = {2025}
}