中文

面向可靠医学视觉问答的潜在视觉推理——MedLVR

计算机视觉与模式识别 2026-04-14 v1 人工智能

摘要

医学视觉-语言模型 (VLM) 在医学视觉问答 (VQA) 中显示出强大的潜力,但其推理主要是文本中心化的:图像一次性编码为静态上下文,后续推理主要依赖于语言。这一范式在临床场景中受到限制,因为准确的答案通常取决于无法可靠保留在静态嵌入中的细微局部视觉证据。我们提出了 \textsc{MedLVR},一种潜在视觉推理框架,将显式的视觉证据状态引入自回归解码。与仅依赖文本基于中间推理不同,\textsc{MedLVR} 在解码器中交错插入短暂的潜在推理段落,通过重复使用隐藏状态作为连续潜在步骤,实现对查询相关视觉证据在答案生成之前的持久化和细化。在有效的视觉监督下,我们采用两阶段训练策略:区域感兴趣 (ROI) 监督的微调将潜在状态与临床相关的图像证据对齐,Visual-Latent Policy Optimization (VLPO) 进一步在结果级别奖励下优化潜在推理和答案生成。在 OmniMedVQA 和五个外部医学 VQA 框架上的实验表明,\textsc{MedLVR} 在最新推理基线上 consistently 超过,平均得分从 48.3% 提升到 53.4%。这些结果表明,潜在视觉推理为保留诊断相关的视觉证据并提高医学 VQA 的可靠性提供了有效机制。

关键词

引用

@article{arxiv.2604.09757,
  title  = {MedLVR: Latent Visual Reasoning for Reliable Medical Visual Question Answering},
  author = {Suyang Xi and Songtao Hu and Yuxiang Lai and Wangyun Dan and Yaqi Liu and Shansong Wang and Xiaofeng Yang},
  journal= {arXiv preprint arXiv:2604.09757},
  year   = {2026}
}