通过结构表示提升视觉语言模型:用于零样图医疗检测的提示词知识库
计算机视觉与模式识别
2025-02-25 v1
摘要
零样图医疗检测可以在不依赖标注医学图像的情况下进一步提高检测性能,展现出巨大的临床价值。最近的研究利用基于 grounding 的视觉语言模型(GLIP)通过在推理阶段使用详细疾病描述作为提示来实现这一目标。然而,这些方法通常将提示视为目标名称的等价上下文,导致无法根据视觉信息分配特定疾病知识,从而导致图像与目标描述之间的对齐粗糙。本文提出了StructuralGLIP,通过引入辅助分支将提示逐层编码为潜在知识库,实现更具上下文感知性和细粒度对齐。具体而言,在每一层,我们从图像表示和知识库中选择高度相似的特征,形成捕捉图像块与目标描述之间细微关系的结构表示。这些特征随后在跨模态中被融合,以进一步提升检测性能。广泛的实验表明,StructuralGLIP在七个零样图医疗检测基准测试中实现了超过4.1%的AP提升,持续在内窥镜图像数据集上为微调模型带来+3.2%的AP提升。
引用
@article{arxiv.2502.16223,
title = {Prompt as Knowledge Bank: Boost Vision-language model via Structural Representation for zero-shot medical detection},
author = {Yuguang Yang and Tongfei Chen and Haoyu Huang and Linlin Yang and Chunyu Xie and Dawei Leng and Xianbin Cao and Baochang Zhang},
journal= {arXiv preprint arXiv:2502.16223},
year = {2025}
}
备注
Accepted as ICLR 2025 conference paper