VLEER:用于可解释全切片图像表征的视觉与语言嵌入
计算机视觉与模式识别
2025-03-03 v1
摘要
视觉-语言模型 (VLMs) 的最新进展在连接视觉和文本模态方面展现出了显著的潜力。在计算病理学中,在广泛的组织病理学图文数据集上预训练的领域特定 VLMs 已在各种下游任务中取得成功。然而,现有研究主要集中在预训练过程和 VLMs 在图像块级别的直接应用上,使其在全切片图像 (WSI) 应用方面的巨大潜力尚未被探索。在本研究中,我们假设预训练的 VLMs 通过定量特征提取本质上捕获了信息丰富且可解释的 WSI 表征。为了验证这一假设,我们引入了用于可解释 WSI 表征的视觉与语言嵌入 (VLEER),这是一种旨在利用 VLMs 进行 WSI 表征的新方法。我们在三个病理 WSI 数据集上系统评估了 VLEER,证明其在 WSI 分析中优于传统的视觉特征。更重要的是,VLEER 提供了可解释性的独特优势,通过利用文本模态进行详细的病理学注释,能够直接提供人类可读的见解,为 WSI 级别的病理学下游任务提供清晰的推理。
引用
@article{arxiv.2502.20850,
title = {VLEER: Vision and Language Embeddings for Explainable Whole Slide Image Representation},
author = {Anh Tien Nguyen and Keunho Byeon and Kyungeun Kim and Jin Tae Kwak},
journal= {arXiv preprint arXiv:2502.20850},
year = {2025}
}
备注
Under review