中文

Equi-ViT:用于鲁棒组织病理学分析的旋转等变 Vision Transformer

图像与视频处理 2026-01-15 v1 人工智能 计算机视觉与模式识别

摘要

Vision Transformers (ViTs) 凭借其通过自注意力建模长程依赖的能力,在计算病理学中获得了迅速采用,弥补了卷积神经网络擅长捕获局部模式但难以进行全局上下文推理的局限性。近期针对病理学的基础模型通过利用大规模预训练进一步提升了性能。然而,标准 ViT 本质上对旋转和反射等变换仍不具备等变性,而这些变换在组织病理学成像中是普遍存在的变化。为解决这一局限性,我们提出了 Equi-ViT,将等变卷积核集成到 ViT 架构的 patch embedding 阶段,赋予所学表征内置的旋转等变性。Equi-ViT 实现了优越的旋转一致 patch embedding,并在不同图像方向上保持稳定的分类性能。我们在公开的结直肠癌数据集上的结果表明,引入等变 patch embedding 提高了数据效率和鲁棒性,这表明等变 Transformer 有望作为 ViT 在组织病理学应用(如数字病理学基础模型)中更具泛化能力的骨干网络。

关键词

引用

@article{arxiv.2601.09130,
  title  = {Equi-ViT: Rotational Equivariant Vision Transformer for Robust Histopathology Analysis},
  author = {Fuyao Chen and Yuexi Du and Elèonore V. Lieffrig and Nicha C. Dvornek and John A. Onofrey},
  journal= {arXiv preprint arXiv:2601.09130},
  year   = {2026}
}

备注

Accepted by IEEE ISBI 2026 4-page paper