通过分层视觉-语言对齐与建模从千兆像素图像中进行少样本学习
计算机视觉与模式识别
2025-12-15 v5
摘要
视觉-语言模型(VLM)近期已被整合到多实例学习(MIL)框架中,以应对全切片图像(WSI)的少样本弱监督分类挑战。一个关键趋势是利用多尺度信息来更好地表征分层组织结构的特征。然而,现有方法通常面临两个关键限制:(1)同一模态内跨尺度交互建模不足(例如5×和20×),以及(2)同一尺度上视觉和文本模态之间的对齐不足。为弥补这些差距,我们提出了HiVE-MIL,一个分层视觉语言框架,构建统一图,包含(1)粗尺度(5×)和细尺度(20×)视觉/文本节点之间的父子链接以捕捉分层关系,以及(2)同一尺度上连接视觉和文本节点的异质边。为进一步增强语义一致性,HiVE-MIL引入了两阶段文本引导的动态过滤机制以移除弱相关的块-文本对,并引入分层对比损失以对齐跨尺度的文本语义。在TCGA乳腺癌、肺癌和肾癌数据集上的广泛实验表明,HiVE-MIL持续优于传统MIL和近期基于VLM的MIL方法,在16样本设置下宏观F1值提升高达4.1%。我们的结果证明了联合建模分层结构和多模态对齐对于从有限病理数据中高效可扩展学习的价值。代码可在 https://github.com/bryanwong17/HiVE-MIL 获取。
引用
@article{arxiv.2505.17982,
title = {Few-Shot Learning from Gigapixel Images via Hierarchical Vision-Language Alignment and Modeling},
author = {Bryan Wong and Jong Woo Kim and Huazhu Fu and Mun Yong Yi},
journal= {arXiv preprint arXiv:2505.17982},
year = {2025}
}
备注
Accepted at NeurIPS 2025