中文

WISE-FUSE:通过VLM与LLM知识融合的由粗到细图像块选择实现高效全切片图像编码

计算机视觉与模式识别 2025-08-21 v1

摘要

计算病理学(CPath)中的全切片图像(WSIs)因其十亿像素级尺度而构成重大计算挑战,通常每张切片需要处理数万到数十万个高分辨率图像块。这导致了高昂的编码成本,预处理和训练时间长达数天甚至数周,使得WSI编码成为实际部署中最显著的瓶颈。在这项工作中,我们提出了WISE-FUSE,这是一个自适应的WSI编码框架,它利用病理学领域的视觉语言模型和大型语言模型,通过选择性地处理诊断相关区域来应对这一挑战。WISE-FUSE首先使用一种保留细粒度诊断特征的知识蒸馏机制,计算低分辨率图像块与类别特定文本描述之间的相似度分数。基于这些相似度分数,我们为目标任务选择一小部分信息丰富的区域,从而在粗粒度层面快速剔除不相关的图像块。然后,对相应的高分辨率图像块进行选择性编码,并与文本嵌入融合以增强诊断上下文。大量实验表明,WISE-FUSE将WSI编码时间缩短了三倍以上,同时实现了与穷举式图像块处理相当或更优的诊断性能,为计算病理学提供了一种可扩展且实用的解决方案。

关键词

引用

@article{arxiv.2508.14537,
  title  = {WISE-FUSE: Efficient Whole Slide Image Encoding via Coarse-to-Fine Patch Selection with VLM and LLM Knowledge Fusion},
  author = {Yonghan Shin and SeungKyu Kim and Won-Ki Jeong},
  journal= {arXiv preprint arXiv:2508.14537},
  year   = {2025}
}