中文

Med-Scout: 通过几何感知的强化学习后训练治愈多模态大语言模型的医学感知几何盲症

计算机视觉与模式识别 2026-02-02 v1 人工智能

摘要

尽管最近的多模态大语言模型(MLLM)在医学诊断方面表现出语言能力,但我们发现即使是最先进的MLLM也存在一个关键的感知缺陷:几何盲症。这种未能将输出锚定在客观几何约束上的缺陷导致了看似合理但事实错误的幻觉,其根源在于优先考虑语言流畅性而非几何保真度的训练范式。本文介绍了Med-Scout,一个新颖的框架,它通过利用未标记医学图像中固有的几何逻辑的强化学习(RL)来“治愈”这种盲症。Med-Scout不依赖昂贵的专家标注,而是通过三个策略性代理任务推导出可验证的监督信号:层次化尺度定位、拓扑拼图重构和异常一致性检测。为了严格量化这一缺陷,我们提出了Med-Scout-Bench,一个专门设计用于评估几何感知的新基准。大量评估表明,Med-Scout显著减轻了几何盲症,在我们的基准上比领先的专有和开源MLLM高出40%以上。此外,这种增强的几何感知能力可以泛化到更广泛的医学理解中,在放射学和综合医学视觉问答任务上取得了优异的结果。

关键词

引用

@article{arxiv.2601.23220,
  title  = {Med-Scout: Curing MLLMs' Geometric Blindness in Medical Perception via Geometry-Aware RL Post-Training},
  author = {Anglin Liu and Ruichao Chen and Yi Lu and Hongxia Xu and Jintai Chen},
  journal= {arXiv preprint arXiv:2601.23220},
  year   = {2026}
}