$MV_{Hybrid}$:在病理学视觉基础模型中利用混合状态空间-视觉 Transformer 主干网络改进空间转录组学预测
计算机视觉与模式识别
2025-08-04 v1 人工智能
计算工程、金融与科学
机器学习
摘要
空间转录组学揭示了组织上下文中的基因表达模式,实现了诸如治疗反应预测等精准肿瘤学应用,但其高昂的成本和技术复杂性限制了临床应用。从常规组织病理学图像预测空间基因表达(生物标志物)提供了一种实用的替代方案,然而当前基于 Vision Transformer (ViT) 主干网络的病理学视觉基础模型 (VFM) 的表现仍低于临床标准。鉴于 VFM 已经在数百万张多样化的全切片图像上进行了训练,我们假设超越 ViT 的架构创新可能更好地捕获与分子表型相关的低频、细微形态学模式。通过证明以负实特征值初始化的状态空间模型表现出强烈的低频偏置,我们引入了 ,这是一种将状态空间模型 (SSM) 与 ViT 相结合的混合主干架构。我们比较了病理学 VFM 的另外五种不同主干架构,所有架构均使用 DINOv2 自监督学习方法在相同的结直肠癌数据集上进行了预训练。我们使用同一生物标志物数据集的随机划分和留一研究法 (LOSO) 设置对所有预训练模型进行了评估。在 LOSO 评估中, 的相关性比性能最佳的 ViT 高 57%,并且在基因表达预测中相比随机划分的性能退化幅度小 43%,分别展现了卓越的性能和鲁棒性。此外,与 ViT 相比, 在分类、图像块检索和生存预测任务中表现出同等或更优的下游性能,展示了其作为下一代病理学 VFM 主干网络的潜力。我们的代码公开于:https://github.com/deepnoid-ai/MVHybrid。
引用
@article{arxiv.2508.00383,
title = {$MV_{Hybrid}$: Improving Spatial Transcriptomics Prediction with Hybrid State Space-Vision Transformer Backbone in Pathology Vision Foundation Models},
author = {Won June Cho and Hongjun Yoon and Daeky Jeong and Hyeongyeol Lim and Yosep Chong},
journal= {arXiv preprint arXiv:2508.00383},
year = {2025}
}
备注
Accepted (Oral) in MICCAI 2025 COMPAYL Workshop