中文

ZACH-ViT:医学影像紧凑视觉转换器中的规模相关归纳偏置

表示论 2026-02-23 v1 代数几何

摘要

视觉转换器依赖位置嵌入和 [CLS] token 编码固定的空间先验。虽然对自然图像有效,但当空间布局信息弱时(医学影像中常见),这些先验可能次优。我们引入 ZACH-ViT(Zero-token Adaptive Compact Hierarchical Vision Transformer),一种紧凑视觉转换器,通过删除位置嵌入和 [CLS] token 实现 patch 处理的排列不变性,采用全局平均池化。Zero-token 表示删除专用聚合 token 和位置编码。Patch token 保持不变。自适应残差投影在严格的参数约束下保持训练稳定性。我们在七个 MedMNIST 数据集上评估 ZACH-ViT,采用严格的 few-shot 协议(50 样本/类、固定超参数、五个随机种子)。结果显示规模相关行为:ZACH-ViT(0.25M 参数,从头训练)在 BloodMNIST 上取得最大优势,在 PathMNIST 上保持竞争力,而在包含更强解剖先验的数据集(OCTMNIST、OrganAMNIST)上相对优势下降,符合我们的假设。组件和池化消融实验表明,位置编码在空间结构增强时略有帮助,而重新引入 [CLS] token 始终不利。这些发现表明,与数据结构相匹配的架构设计可超过通用基准的主导地位。尽管体积最小且无预训练,ZACH-ViT 在数据稀缺条件下仍能实现竞争性能,适用于紧凑医学影像和低资源场景。代码:https://github.com/Bluesman79/ZACH-ViT

关键词

引用

@article{arxiv.2602.17927,
  title  = {Cohomological boundedness of twisted coherent Springer sheaves},
  author = {Oron Y. Propp},
  journal= {arXiv preprint arXiv:2602.17927},
  year   = {2026}
}

备注

66 pages, 4 appendices