流产病变分类的高效多模态视觉-语言特征融合
计算机视觉与模式识别
2025-08-06 v1
摘要
通过全切片图像(WSI)准确预测流产疾病对于预防严重的母婴并发症至关重要。然而,WSI 分析因数据体量巨大而面临显著计算挑战。现有 WSI 分类方法存在关键局限:(1)补丁选择策略不足,要么牺牲性能,要么未能显著降低计算需求;(2)基于补丁级别的处理方法导致丢失全层组织背景。为此,我们提出面向 placental disease Diagnosis 的高效多模态框架,命名为 EmmPD。我们的方法引入两阶段补丁选择模块,结合无参数和可学习压缩策略,在计算效率与关键特征保留之间实现最优平衡。此外,我们开发了混合多模态融合模块,利用自适应图学习来增强病理特征表征,并整合文本医学报告以丰富全局背景理解。在自构建的患者级别流产数据集以及两个公开数据集上的大量实验表明,我们的方法实现了最先进的诊断性能。代码已公开于 https://github.com/ECNU-MultiDimLab/EmmPD。
引用
@article{arxiv.2508.03277,
title = {Efficient Multi-Slide Visual-Language Feature Fusion for Placental Disease Classification},
author = {Hang Guo and Qing Zhang and Zixuan Gao and Siyuan Yang and Shulin Peng and Xiang Tao and Ting Yu and Yan Wang and Qingli Li},
journal= {arXiv preprint arXiv:2508.03277},
year = {2025}
}
备注
Accepted by ACMMM'25