Libra-MIL:融合任务特定语言先验的多模态原型立体少样本全切片图像分类
计算机视觉与模式识别
2025-11-12 v1 人工智能
摘要
虽然大语言模型 (LLM) 正成为计算病理学中一个有前景的方向,但千兆像素全切片图像 (WSI) 的巨大计算成本需要使用多示例学习 (MIL) 来实现有效建模。一个关键挑战是,病理任务通常仅提供包级标签,而 LLM 生成的实例级描述往往由于缺乏细粒度的医学知识而存在偏差。为了解决这个问题,我们提出构建任务特定的病理实体原型对于学习可泛化特征和增强模型可解释性至关重要。此外,现有的视觉-语言 MIL 方法通常采用单向引导,限制了跨模态协同作用。在本文中,我们引入了一种新方法,基于多模态原型的多示例学习,通过平衡的信息压缩方案促进双向交互。具体而言,我们利用冻结的 LLM 生成任务特定的病理实体描述,并将其作为文本原型进行学习。同时,视觉分支学习实例级原型,以减轻模型对冗余数据的依赖。在融合阶段,我们采用了基于相似性度量的立体最优传输 (SOT) 算法,从而在更高维空间中促进更广泛的语义对齐。我们在三个不同的癌症数据集上进行了少样本分类和可解释性实验,结果证明了我们提出的方法具有卓越的泛化能力。
引用
@article{arxiv.2511.07941,
title = {Libra-MIL: Multimodal Prototypes Stereoscopic Infused with Task-specific Language Priors for Few-shot Whole Slide Image Classification},
author = {Zhenfeng Zhuang and Fangyu Zhou and Liansheng Wang},
journal= {arXiv preprint arXiv:2511.07941},
year = {2025}
}