PathM3:用于全切片图像分类与描述生成的多模态多任务多示例学习框架
计算机视觉与模式识别
2025-03-18 v2 人工智能
摘要
在计算组织病理学领域,全切片图像(WSI)和诊断描述为做出诊断决策提供了有价值的见解。然而,将WSI与诊断描述对齐提出了重大挑战。这种困难源于两个主要因素:1)千兆像素级的WSI不适合直接输入深度学习模型,且切片之间的冗余和相关性需要更多关注;2)真实的WSI诊断描述极其有限,使得训练有效模型变得困难。为了克服这些障碍,我们提出了PathM3,一个用于WSI分类和描述生成的多模态、多任务、多示例学习(MIL)框架。PathM3采用基于查询的Transformer来有效地将WSI与诊断描述对齐。鉴于组织病理学视觉模式在WSI中冗余分布,我们使用考虑实例之间相关性的MIL方法聚合每个切片特征。此外,我们的PathM3通过以多任务联合学习的方式利用有限的WSI诊断描述数据,克服了WSI级描述的数据稀缺问题。大量实验表明,改进的分类精度和描述生成证明了我们的方法在WSI分类和描述生成任务上的有效性。
引用
@article{arxiv.2403.08967,
title = {PathM3: A Multimodal Multi-Task Multiple Instance Learning Framework for Whole Slide Image Classification and Captioning},
author = {Qifeng Zhou and Wenliang Zhong and Yuzhi Guo and Michael Xiao and Hehuan Ma and Junzhou Huang},
journal= {arXiv preprint arXiv:2403.08967},
year = {2025}
}