基于语义归纳偏置的可解释视觉语言生存分析——用于计算病理学
计算机视觉与模式识别
2025-02-12 v4
摘要
组织病理全切片图像 (Whole-Slide Images, WSIs) 为计算病理学 (CPATH) 中的癌症预后评估提供了重要工具。尽管现有的生存分析 (SA) 方法取得了精彩进展,但通常仅依赖高度表达的网络架构和粗糙的患者层次标签,从而在从巨像级 WSIs 中学习视觉预后表征方面受到了数据稀缺和标准多实例学习 (MIL) 框架的限制。为此,本文首次提出了新的基于视觉语言的生存分析 (VLSA) 范式。具体而言:(1) VLSA 由病理学视觉语言基础模型驱动,不再依赖高性能网络,显示出数据效率优势。(2) 在视觉端,VLSA 将文本生存先验编码为辅助信号,以引导视觉生存特征在实例级别上的聚合,从而弥补 MIL 中的弱监督。此外,鉴于生存分析的特点,我们提出了 i) 基于序数生存提示学习将连续生存标签转换为文本提示; ii) 序数发病函数作为预测目标,以使 SA 适用于基于视觉语言的预测。值得注意的是,VLSA 的预测可通过基于Shapley值的方法直观解释。在五个数据集上的广泛实验确认了方案的有效性。我们的 VLSA 为 CPATH 中的 SA 开辟了一条新路径,为弱监督 MIL 提供了有效手段,从巨像级 WSIs 中学习有价值的预后线索。我们的源代码 available at https://github.com/liupei101/VLSA。
引用
@article{arxiv.2409.09369,
title = {Interpretable Vision-Language Survival Analysis with Ordinal Inductive Bias for Computational Pathology},
author = {Pei Liu and Luping Ji and Jiaxiang Gou and Bo Fu and Mao Ye},
journal= {arXiv preprint arXiv:2409.09369},
year = {2025}
}
备注
Accepted to ICLR 2025