MedCLM:通过链律-课程学习在医学视觉语言模型中进行局部化与推理
计算机视觉与模式识别
2025-10-07 v1 人工智能
计算与语言
机器学习
摘要
将临床诊断推理与人工智能相结合仍是医学影像领域的核心挑战。我们提出 MedCLM,一个自动化管道,将检测数据集转换为由链式思维(Chain-of-Thought, CoT)推理构成的大规模医学视觉问答(VQA)数据,方法是通过将病灶框与器官分割及结构化论证链接。这些上下文信号使医学视觉语言模型能够生成带有分步骤推理的问答对。为有效利用此数据,我们提出集成式 CoT-课程策略,包括:易stage使用显式病灶框进行视觉定位,中stage鼓励隐式定位,难stage进行弱监督推理。实验结果表明,MedCLM 在多个医学 VQA 基准测试上实现了最先进的性能,为开发临床导向的医学视觉语言模型提供了可扩展框架。
引用
@article{arxiv.2510.04477,
title = {MedCLM: Learning to Localize and Reason via a CoT-Curriculum in Medical Vision-Language Models},
author = {Soo Yong Kim and Suin Cho and Vincent-Daniel Yun and Gyeongyeon Hwang},
journal= {arXiv preprint arXiv:2510.04477},
year = {2025}
}