mTREE:基于多级文本引导的全切片图像分析端到端学习
计算机视觉与模式识别
2024-05-29 v1
摘要
多模态学习擅长整合视觉和文本数据,但其在组织病理图像和文本分析中的应用仍具有挑战,特别是对于大型高分辨率图像如巨像素全切片图像(WSI)而言。当前方法通常依赖手动区域标记或多阶段学习来组装局部表示(例如块级)以构建全局特征(例如切片级)。然而,尚无有效方法能够在无缝的端到端过程中将多尺度图像表示与文本数据集成在一起。本研究引入了多级文本引导表示端到端学习(Multi-Level Text-Guided Representation End-to-End Learning, mTREE)。这种新颖的文本引导方法有效地通过利用伴随的文本病理信息来捕获多尺度 WSI 表示。mTREE 创新性地将——全局到局部的关键区域定位和开发面向切片级的图像-文本表示(局部到全局)—整合到统一的端到端学习框架中。在该模型中,文本信息具有双重用途:首先,作为注意力图准确识别关键区域;其次,作为将文本特征整合到图像综合表示的通道。我们的研究通过两种图像相关任务中的定量分析展示了 mTREE 的有效性:分类和生存预测,凸显其在基线上的显著优势。
引用
@article{arxiv.2405.17824,
title = {mTREE: Multi-Level Text-Guided Representation End-to-End Learning for Whole Slide Image Analysis},
author = {Quan Liu and Ruining Deng and Can Cui and Tianyuan Yao and Vishwesh Nath and Yucheng Tang and Yuankai Huo},
journal= {arXiv preprint arXiv:2405.17824},
year = {2024}
}