Whole-Slide 多实例学习中的空间盲区
计算机视觉与模式识别
2026-05-19 v1 人工智能
摘要
Whole-Slide MIL 模型一旦在 patch 嵌入上置入图谱、Transformer 或时序模块,即被称为具备上下文感知能力。我们指出,这一标签可能具有误导性。在组织结构是诊断信号组成部分的病理学任务中,多个强大的 MIL 基线在 patch 坐标置换后几乎不变的 slide level AUC 表现得很好。它们的预测是准确的,但主要是组合式的。我们将这种失效模式称为空间盲区。我们的解释是基于优化的:在 slide level 监督下,稠密的外观统计信息被早期学习,导致稀疏的空间关系梯度很弱。ResTopoMIL 通过首先拟合置换不变的特征直方图,然后在其上冻结它,让轻量级图分支在坐标置换约束下学习残差来解决此问题。该架构设计简单;干预点在于如何训练空间分支。在 9 个公开的 WSI 基准数据集上,ResTopoMIL 在分类和生存预测方面均有所改进,仅使用 115 万参数,恢复了对坐标置换的敏感性,并在 CAMELYON-16 上提供更强的局部定位证据。
引用
@article{arxiv.2605.17449,
title = {Spatial Blindness in Whole-Slide Multiple Instance Learning},
author = {Xiangyu Li and Ran Su},
journal= {arXiv preprint arXiv:2605.17449},
year = {2026}
}
备注
28 pages, 8 figures, 16 tables