基于多模态最优传输与全局结构一致性的协同注意力 Transformer 用于生存预测
计算机视觉与模式识别
2023-09-12 v2
摘要
生存预测是一项复杂的序数回归任务,旨在预测死亡风险排序,通常受益于组织学与基因组数据的融合。尽管在病理与基因组联合学习方面已取得进展,现有方法仍面临挑战:1)由于病理图像尺寸巨大,难以有效表示十亿像素级全切片图像(WSI)。2)组织学肿瘤微环境(TME)内的相互作用对生存分析至关重要。虽然当前方法试图通过组织学与基因组数据间的协同注意力建模这些相互作用,但它们仅关注跨模态的密集局部相似性,无法捕捉潜在结构间的全局一致性,即 TME 相关的组织学相互作用与基因组数据的共表达。为应对这些挑战,我们提出一种具有全局结构一致性的多模态最优传输协同注意力 Transformer 框架,其中最优传输(OT)用于匹配 WSI 的图像块与基因嵌入,以筛选信息丰富的图像块来表示十亿像素 WSI。更重要的是,基于 OT 的协同注意力提供全局感知,有效捕捉 TME 内的结构相互作用用于生存预测。为克服 OT 的高计算复杂度,我们通过以非平衡小批量 OT 近似原始 OT,在 WSI 图像块的微批次上提出一种鲁棒且高效的实现。大量实验表明,在五个基准数据集上本方法优于当前最优方法。代码已公开。
引用
@article{arxiv.2306.08330,
title = {Multimodal Optimal Transport-based Co-Attention Transformer with Global Structure Consistency for Survival Prediction},
author = {Yingxue Xu and Hao Chen},
journal= {arXiv preprint arXiv:2306.08330},
year = {2023}
}
备注
11 pages, 4 figures, accepted by ICCV 2023