通过知识描述增强视觉语言模型在异常 grounding 任务中的表现
计算机视觉与模式识别
2025-03-06 v1 计算与语言
摘要
视觉语言模型(VLM)在视觉 grounding任务中展现了惊人的能力,但在医学领域,特别是针对医学图像中异常检测和定位的效果仍未得到充分探索。一个主要挑战是医学术语的复杂和抽象性,使得直接将特定异常术语与其对应的视觉特征关联困难。本文提出了一种新方法,通过利用分解的医学知识来增强VLM在医学异常检测和定位方面的性能。我们不直接提示模型识别特定异常,而是 focus on 将医学概念分解为基本属性和常见视觉模式。这种策略促进了文本描述与视觉特征之间的更强对齐,提高了医学图像中异常的识别和定位能力。我们在0.23B的Florence-2基础模型上进行评估,证明该方法在仅使用其它7B LLaVA-based医学VLM训练数据的1.5%的情况下,仍能实现对异常 grounding相当的性能。实验结果还显示,我们的方法在已知和以前未见的异常方面都有效,表明其强大的泛化能力。
引用
@article{arxiv.2503.03278,
title = {Enhancing Abnormality Grounding for Vision Language Models with Knowledge Descriptions},
author = {Jun Li and Che Liu and Wenjia Bai and Rossella Arcucci and Cosmin I. Bercea and Julia A. Schnabel},
journal= {arXiv preprint arXiv:2503.03278},
year = {2025}
}
备注
11 pages, 3 figures