面向零样本核检测的属性语义自动提示:基于视觉语言预训练模型
摘要
大规模视觉语言预训练模型(VLPM)在通过文本提示进行自然场景目标检测方面展现了卓越性能。然而,其在组织病理图像的零样本核检测应用尚未得到广泛探索,主要由于医学图像特征与预训练中使用的网络来源文本-图像对之间的差异显著。本文旨在探讨基于Grounded Language-Image Pre-training (GLIP)的视觉语言预训练模型进行零样本核检测的潜力。具体提出创新的自动提示管道——AttriPrompter,包括属性生成、属性增强与相关性排序,以避免主观的人工提示设计。AttriPrompter利用VLPM的文本到图像对齐功能,创建语义丰富的文本提示输入GLIP进行初始零样本核检测。此外,本文提出自训练知识蒸馏框架,采用GLIP作为教师模型并利用其初始预测生成伪标签,以应对高核密度带来的检测缺失、误报及重叠实例等挑战。该方法在无标签核检测中展现出惊人的性能,超越所有现有无监督方法,并显示出卓越的通用性。值得注意的是,本工作凸显了基于自然图像-文本对预训练的VLPM在医学领域下游任务中的惊人潜力。代码将发布于https://github.com/wuyongjianCODE/AttriPrompter。
引用
@article{arxiv.2410.16820,
title = {AttriPrompter: Auto-Prompting with Attribute Semantics for Zero-shot Nuclei Detection via Visual-Language Pre-trained Models},
author = {Yongjian Wu and Yang Zhou and Jiya Saiyin and Bingzheng Wei and Maode Lai and Jianzhong Shou and Yan Xu},
journal= {arXiv preprint arXiv:2410.16820},
year = {2024}
}
备注
This article has been accepted for publication in a future issue of IEEE Transactions on Medical Imaging (TMI), but has not been fully edited. Content may change prior to final publication. Citation information: DOI: https://doi.org/10.1109/TMI.2024.3473745 . Code: https://github.com/wuyongjianCODE/AttriPrompter