PathFLIP: 面向通用计算病理学的细粒度语言-图像预训练
计算机视觉与模式识别
2025-12-22 v1
摘要
尽管视觉-语言模型(VLM)在计算病理学(CPath)领域取得了显著进展,但全切片图像(WSI)的千兆像素尺度和空间异质性仍然对多模态理解构成挑战。现有的对齐方法难以捕捉切片中数千个斑块的文本描述与视觉线索之间的细粒度对应关系,从而影响了它们在下游任务中的性能。在本文中,我们提出了PathFLIP(病理学细粒度语言-图像预训练),一个用于整体WSI解释的新颖框架。PathFLIP将切片级描述分解为区域级子描述,并生成文本条件化的区域嵌入,以促进精确的视觉-语言定位。通过利用大型语言模型(LLM),PathFLIP能够无缝地遵循多样化的临床指令并适应不同的诊断上下文。此外,它在多种范式下展现出多功能能力,高效地处理切片级分类与检索、细粒度病灶定位以及指令跟随。大量实验表明,PathFLIP在四个代表性基准测试中优于现有的大规模病理学VLM,同时所需的训练数据显著更少,为临床实践中细粒度、指令感知的WSI解释铺平了道路。
引用
@article{arxiv.2512.17621,
title = {PathFLIP: Fine-grained Language-Image Pretraining for Versatile Computational Pathology},
author = {Fengchun Liu and Songhan Jiang and Linghan Cai and Ziyue Wang and Yongbing Zhang},
journal= {arXiv preprint arXiv:2512.17621},
year = {2025}
}