中文

MEDIC-AD:向医学视觉-语言模型展示临床智能

计算机视觉与模式识别 2026-03-31 v1

摘要

皮肤瘤检测、症状跟踪和视觉可解释性是医学图像分析中的核心任务,但当前医学视觉-语言模型(VLMs)仍缺乏将其广泛知识转化为临床可操作输出的机制。为弥合这一差距,我们提出MEDIC-AD,一个面向临床的 VLM,通过阶段性框架强化这三项能力。首先,learnable anomaly-aware tokens (<Ano>) 鼓励模型聚焦异常区域,构建更具辨识力的皮肤瘤中心表征。其次,inter image difference tokens (<Diff>) 显式编码不同检查之间的时间性变化,使模型能够区分疾病负荷的恶化、改善或稳定。最后,一个专门的可解释性阶段训练模型生成热图,突出与皮肤瘤相关的区域,提供与模型推理一致的清晰视觉证据。通过我们的阶段性设计,MEDIC-AD 在异常检测、症状跟踪和异常分割任务上稳步提升性能,实现了对闭源模型和医学专用基线的 SOTA 成绩。在来自真实医院工作流程收集的真实纵向临床数据上的评估进一步表明,MEDIC-AD 在实际患者监测和决策支持工作流程中交付稳健的预测和临床忠实的解释。

关键词

引用

@article{arxiv.2603.27176,
  title  = {MEDIC-AD: Towards Medical Vision-Language Model's Clinical Intelligence},
  author = {Woohyeon Park and Jaeik Kim and Sunghwan Steve Cho and Pa Hong and Wookyoung Jeong and Yoojin Nam and Namjoon Kim and Ginny Y. Wong and Ka Chun Cheung and Jaeyoung Do},
  journal= {arXiv preprint arXiv:2603.27176},
  year   = {2026}
}