中文

ASMIL:面向全切片组织学图像的注意力稳定型多实例学习

计算机视觉与模式识别 2026-03-10 v1

摘要

注意力机制多实例学习(MIL)已成为全切片组织学图像(WSI)诊断的强大框架,利用注意力机制对实例级特征进行聚合以生成包级别预测。尽管如此,我们发现此类方法存在新的失效模式:注意力动态不稳定。在四种代表性注意力-based MIL 方法和两个公开 WSI 数据集上,我们观察到注意力分布在不同 epoch 之间呈现振荡,未收敛至一致模式,导致性能下降。这种不稳定性加剧了两个先前报告的挑战:过拟合和注意力分布过度集中。为同时克服这三重限制,我们引入注意力稳定型多实例学习(ASMIL),一个新型统一框架。ASMIL 使用锚模模型稳定注意力,将 softmax 替换为归一化 sigmoid 函数以防止过度集中,并应用 token 随机丢弃以缓解过拟合。大量实验表明,ASMIL 在 state-of-the-art 方法上实现了最高可达 6.49% 的 F1 分数提升。此外,将锚模模型和归一化 sigmoid 集成到现有注意力-based MIL 方法中,能一致提升其性能,F1 分数提升最高可达 10.73%。所有代码和数据均公开于 https://github.com/Linfeng-Ye/ASMIL。

关键词

引用

@article{arxiv.2603.06658,
  title  = {ASMIL: Attention-Stabilized Multiple Instance Learning for Whole Slide Imaging},
  author = {Linfeng Ye and Shayan Mohajer Hamidi and Zhixiang Chi and Guang Li and Mert Pilanci and Takahiro Ogawa and Miki Haseyama and Konstantinos N. Plataniotis},
  journal= {arXiv preprint arXiv:2603.06658},
  year   = {2026}
}

备注

39 pages, 26 figures