中文

MedVol-R1:基于奖励驱动的体积推理分段证据锚定

计算机视觉与模式识别 2026-05-27 v1 人工智能

摘要

体积推理分段 (VRS) 旨在从自由形式的临床查询中对 3D 医学扫描中的目标区域进行分段,其中指代物常常是隐式的,需要医学知识和体积锚定推理。现有方法通常依赖专用的分段标记将语言与掩码解码连接,但这种耦合将决策过程压缩到不透明的潜在表示中,限制了可解释性和对多样化叙述表达的泛化。本文提出 MedVol-R1,一种基于强化学习的 VRS 框架,显式地将证据锚定从体积描绘中解耦:LVLM 将临床推理锚定到可验证的 2D 证据锚点(关键横断面和 2D 边界框),然后通过冻结的 MedSAM2 模块传递到连贯的 3D 掩码中。我们采用冷启动监督微调 followed by GRPO,由多组件奖励机制驱动,鼓励信息丰富的证据选择、准确的 2D 空间锚定以及跨切片的体积一致性,无需昂贵的链式思维注释。实验在 CT-ORG、AbdomenCT-1K 和 KiTS23 数据集(来自 M3D-Seg benchmark)上表明,MedVol-R1 在强大的基线上一致实现了业界最佳性能,强化学习相对于纯监督微调提供了明确的提升。

关键词

引用

@article{arxiv.2605.26621,
  title  = {MedVol-R1: Reward-Driven Evidence Grounding for Volumetric Reasoning Segmentation},
  author = {Zichun Wang and Hairong Shi and Bingzheng Wei and Yan Xu and Zihua Wang},
  journal= {arXiv preprint arXiv:2605.26621},
  year   = {2026}
}