基于细粒度视觉-语义交互的泛化性全切片图像分类
计算机视觉与模式识别
2024-04-08 v2
摘要
全切片图像(WSI)分类通常被表述为多实例学习(MIL)问题。近年来,视觉-语言模型(VLM)在 WSI 分类中展现出卓越的性能。然而,现有方法利用粗粒度的病理描述进行视觉表示监督,这不足以捕捉病理图像复杂的视觉外观,阻碍了模型在多样化下游任务上的泛化能力。此外,处理高分辨率 WSI 的计算成本可能很高。在本文中,我们提出了一种新颖的“细粒度视觉-语义交互”(FiVE)框架用于 WSI 分类。它旨在通过利用局部视觉模式与细粒度病理语义之间的交互来增强模型的泛化能力。具体来说,通过精心设计的查询,我们首先利用大型语言模型从各种非标准化的原始报告中提取细粒度的病理描述。然后将输出的描述重构为用于训练的细粒度标签。通过引入任务特定细粒度语义(TFS)模块,我们使提示能够捕捉 WSI 中的关键视觉信息,从而显著增强表示学习和泛化能力。此外,考虑到病理视觉模式在组织切片中冗余分布,我们在训练期间对视觉实例的子集进行采样。我们的方法展现出强大的泛化性和可迁移性,在 TCGA 肺癌数据集上的少样本实验中,其准确率至少比同类方法高出 9.19%。代码可在 https://github.com/ls1rius/WSI_FiVE 获取。
引用
@article{arxiv.2402.19326,
title = {Generalizable Whole Slide Image Classification with Fine-Grained Visual-Semantic Interaction},
author = {Hao Li and Ying Chen and Yifei Chen and Wenxian Yang and Bowen Ding and Yuchen Han and Liansheng Wang and Rongshan Yu},
journal= {arXiv preprint arXiv:2402.19326},
year = {2024}
}
备注
Accepted by CVPR 2024