中文

VGAT: 从生成式视觉问答过渡到基因重构的癌症生存分析框架

计算机视觉与模式识别 2025-06-30 v3

摘要

多模态学习结合病理图像和基因序列可增强癌症生存分析,但因资源不足地区缺乏基因测序,临床实施面临障碍。为仅使用全切片图像 (WSI) 实现生存预测,我们提出 Visual-Genomic Answering-Guided Transformer (VGAT),一种集成视觉问答 (VQA) 技术用于基因模态重构的框架。通过适应 VQA 的文本特征提取方法,我们导出稳定的基因表示,规避原始基因数据的维度挑战。同时,基于聚类的视觉提示模块选择性地增强判别性 WSI 切片,解决未过滤图像区域的噪声问题。在五个 TCGA 数据集上评估,VGAT 超越了现有的仅使用 WSI 方法,证明了无需测序即可实现基于基因信息的推断。这一方法桥接了多模态研究与临床可行性,尤其适用于资源受限的环境。代码链接为 https://github.com/CZZZZZZZZZZZZZZZZZ/VGAT。

关键词

引用

@article{arxiv.2503.19367,
  title  = {VGAT: A Cancer Survival Analysis Framework Transitioning from Generative Visual Question Answering to Genomic Reconstruction},
  author = {Zizhi Chen and Minghao Han and Xukun Zhang and Shuwei Ma and Tao Liu and Xing Wei and Lihua Zhang},
  journal= {arXiv preprint arXiv:2503.19367},
  year   = {2025}
}

备注

Accepted by ICME2025