面向癌症生存预测的多模态专家混合模型(MoME)
图像与视频处理
2024-06-17 v1 计算机视觉与模式识别
摘要
生存分析是一项具有挑战性的任务,需要整合Whole Slide Images(WSI)和基因组数据进行全面决策。该任务存在两个主要挑战:显著的异质性以及两种模态之间复杂的跨模态和内模态相互作用。以往方法采用共注意力方法,仅在独立编码后对两种模态的特征进行一次融合。然而,这些方法对于建模该任务不够充分,因为两种模态的异质性很大。为解决这些问题,我们提出了偏执性渐进编码(BPE)范式,同时进行编码和融合。该范式在编码另一模态时将其用作参考。这使得通过多个交替迭代实现模态的深度融合,逐渐减少跨模态差异,促进互补互动。除了模态异质性之外,生存分析涉及来自WSI、基因组及其组合的各种生物标志物。关键生物标志物可能存在于个体变异下的不同模态中,这需要模型对特定情景进行灵活适应。因此,我们进一步提出了多模态专家混合模型(MoME)层,用于在BPE范式的每个阶段动态选择针对特定情景的定制专家。专家通过不同程度地整合另一模态的参考信息,使编码过程能够在不同模态之间实现平衡或偏执关注。在广泛的数据集上进行的大量实验结果表明,我们的方法在TCGA-BLCA、TCGA-UCEC和TCGA-LUAD等数据集上表现优异。代码已公开于https://github.com/BearCleverProud/MoME。
引用
@article{arxiv.2406.09696,
title = {MoME: Mixture of Multimodal Experts for Cancer Survival Prediction},
author = {Conghao Xiong and Hao Chen and Hao Zheng and Dong Wei and Yefeng Zheng and Joseph J. Y. Sung and Irwin King},
journal= {arXiv preprint arXiv:2406.09696},
year = {2024}
}
备注
8 + 1/2 pages, early accepted to MICCAI2024