MedGround:用验证 grounding 数据弥合医学视觉语言模型证据差距
计算机视觉与模式识别
2026-01-13 v1 人工智能
摘要
视觉语言模型(VLMs)可生成令人信服的临床叙述,但常在视觉锚定方面受限。我们认为这一限制源于高质量大规模临床指代-定位配对的稀缺。为此,我们引入 MedGround,一个自动化管道,将分割资源转化为高质量医学指代 grounding 数据。利用专家掩码作为空间锚点,MedGround 精确推导定位目标,提取形状和空间线索,并指导 VLMs 合成反映形态学和位置的自然临床查询。为确保数据严谨,多阶段验证系统集成严格的格式检查、几何和医学先验规则,以及基于图像的视觉判断,以过滤模糊或缺乏视觉支持的样本。最后,我们提出 MedGround-35K,一个新型多模态医学数据集。广泛实验表明,使用 MedGround-35K 训练的 VLMs 在指代锚定性能方面持续获得改进,增强多对象语义消歧,并在未见的锚定设置下表现出强大的泛化能力。这一工作凸显 MedGround 作为一种可扩展的数据驱动方法,将医学语言锚定在可验证的视觉证据之上。数据集和代码将在接受后公开。
引用
@article{arxiv.2601.06847,
title = {MedGround: Bridging the Evidence Gap in Medical Vision-Language Models with Verified Grounding Data},
author = {Mengmeng Zhang and Xiaoping Wu and Hao Luo and Fan Wang and Yisheng Lv},
journal= {arXiv preprint arXiv:2601.06847},
year = {2026}
}
备注
18 pages, 10 figures