中文

基于图神经网络的ViTCap:用于Whole Slide Image分类和描述的视觉Transformer多实例学习

计算机视觉与模式识别 2025-07-10 v1 机器学习

摘要

显微镜组织病理图像的评估对于准确的癌症诊断和治疗至关重要。Whole Slide Image(WSI)的分类和描述已成为计算机辅助病理学中的关键任务。然而,微scopic WSI面临诸多挑战,如冗余补丁以及因主观病理学家拍摄导致的未知补丁位置。此外,生成自动病理描述仍是一大挑战。为此,我们引入了新的GNN-ViTCap框架,用于从组织病理微scopic图像中进行分类和描述生成。首先,视觉特征提取器生成补丁嵌入。通过使用深度嵌入聚类动态聚类这些嵌入并通过标量点积注意力机制选择代表性补丁来消除冗余补丁。我们通过将每个节点连接到相似矩阵中其最近的邻居来构建图,并应用图神经网络来捕获局部和全局上下文。通过线性层将聚合的图像嵌入投影到语言模型的输入空间,并与描述标记组合,用于微调大型语言模型。我们在BreakHis和PatchGastric数据集上对方法进行了验证。GNN-ViTCap在分类任务中实现了0.934的F1分数和0.963的AUC,在描述生成任务中实现了0.811的BLEU-4分数和0.569的METEOR分数。实验结果表明,GNN-ViTCap优于当前最先进的方法,为基于显微镜的患者诊断提供了可靠且高效的解决方案。

关键词

引用

@article{arxiv.2507.07006,
  title  = {GNN-ViTCap: GNN-Enhanced Multiple Instance Learning with Vision Transformers for Whole Slide Image Classification and Captioning},
  author = {S M Taslim Uddin Raju and Md. Milon Islam and Md Rezwanul Haque and Hamdi Altaheri and Fakhri Karray},
  journal= {arXiv preprint arXiv:2507.07006},
  year   = {2025}
}