MedEyes:用于医学渐进诊断的动态视觉聚焦学习
计算机视觉与模式识别
2026-03-13 v2 人工智能
摘要
准确的医学诊断通常涉及逐步的视觉聚焦和迭代推理,这种特征在临床工作流程中常见。虽然最近的视觉语言模型通过强化学习与可验证奖励(RLVR)展示出有前景的链式思维(CoT)推理能力,但其纯基于策略的学习范式倾向于强化表面连贯但临床上不准确的推理路径。我们提出MedEyes,一种新颖的强化学习框架,通过逐步注意和解释相关医学图像区域来动态建模临床医生风格的诊断推理。通过纳入离策略专家指导,MedEyes将专家视觉搜索轨迹转换为结构化的外部行为信号,引导模型走向临床上一致的视觉推理。我们设计了注视引导推理导航器(Gaze-guided Reasoning Navigator, GRN),通过双模式探索策略模拟诊断过程:扫描系统性异常定位和钻取详细区域分析。为平衡专家模仿与自主发现,我们引入置信值抽样器(Confidence Value Sampler, CVS),采用核抽样和自适应终止创建多样且可信的探索路径。最后,双流GRPO优化框架解耦离策略和在策略学习信号,缓解奖励融合和熵塌陷。实验表明,MedEyes在多个医学VQA基准上平均提升了8.5个百分点,验证了MedEyes在构建可信医学AI系统方面的潜力。代码可在 https://github.com/zhcz328/MedEyes 获取。
引用
@article{arxiv.2511.22018,
title = {MedEyes: Learning Dynamic Visual Focus for Medical Progressive Diagnosis},
author = {Chunzheng Zhu and Yangfang Lin and Shen Chen and Yijun Wang and Jianxin Lin},
journal= {arXiv preprint arXiv:2511.22018},
year = {2026}
}
备注
AAAI 2026, Medical Chain-of-Thought (CoT), Reinforcement Learning with Verifiable Rewards (RLVR), Multimodal Grounded Reasoning