基于 Agentic 强化学习的无标注医学视觉推理
计算机视觉与模式识别
2026-04-10 v1 人工智能
摘要
医学视觉语言模型( VLM)拥有巨大的潜力,但其推理能力常受制于仅依赖文本的范式,无法将推断锚定在视觉证据上。这种限制不仅削弱了在需要精细视觉分析的任务上的性能,也引入了视觉幻觉在安全关键应用中的风险。因此,我们提出了 MedVR,一种新型的强化学习框架,使其能够为医学 VLM 实现无标注的视觉推理。其核心创新在于两个协同机制:熵导向的视觉再锚定( EVR)利用模型不确定性引导探索,而以共识为基础的信用分配( CCA)从 rollout 一致性中提炼伪监督。没有任何针对中间步骤的人工标注,MedVR 在多样化的公开医学 VQA 数据集上实现了最先进的性能,显著优于现有模型。通过直接与视觉证据进行推理,MedVR 促进了医学 AI 在临床部署中所必需的鲁棒性和透明性。
引用
@article{arxiv.2604.08203,
title = {MedVR: Annotation-Free Medical Visual Reasoning via Agentic Reinforcement Learning},
author = {Zheng Jiang and Heng Guo and Chengyu Fang and Changchen Xiao and Xinyang Hu and Lifeng Sun and Minfeng Xu},
journal= {arXiv preprint arXiv:2604.08203},
year = {2026}
}
备注
Accepted by ICLR 2026