从多粒度语言学习提升医学视觉理解
计算机视觉与模式识别
2026-02-20 v2
摘要
最近的图像-文本预训练技术显著增强了视觉理解,通过对齐视觉和文本表示实现。对比式语言-图像预训练(CLIP)在多模态学习中发挥了关键作用。然而,其关注单标签、单粒度对齐,限制了其在医学影像等复杂领域的有效性,因为图像常对应多个高层标签(如疾病类别),且标注粒度不同(如诊断描述、临床解释)。为此,我们提出了多粒度语言学习(MGLL),一种针对提高多标签和跨粒度对齐的对比学习框架。MGLL利用结构化的多标签监督,整合不同粒度的文本描述,引入基于点约束的软标签监督以增强对齐。MGLL采用光滑的KL散度确保跨粒度一致性,同时保持计算效率作为视觉-语言模型的即插即用模块。在我们构建的大规模多粒度数据集上预训练,并在多个数据集上评估,MGLL在下游任务中超越了其他最先进方法。代码已公开 https://github.com/HUANGLIZI/MGLL。
引用
@article{arxiv.2511.15943,
title = {Boosting Medical Visual Understanding From Multi-Granular Language Learning},
author = {Zihan Li and Yiqing Wang and Sina Farsiu and Paul Kinahan},
journal= {arXiv preprint arXiv:2511.15943},
year = {2026}
}
备注
Accepted by ICLR 2026. 40 pages